Yemilice - 博客园

公告

2016年12月20日

摘要：今天群里有个人反映某个网址爬出来的网页源代码出现中文乱码，我研究了半天，终于找到了解决方法。一开始，我是这样做的： import requests url = 'http://search.51job.com/jobsearch/search_result.php?fromJs=1&jobarea 阅读全文

posted @ 2016-12-20 01:23 Yemilice 阅读(21594) 评论(2) 推荐(3) 编辑

2016年12月17日

cookielib和urllib2模块相结合模拟网站登录

摘要： 1.cookielib模块 cookielib模块的主要作用是提供可存储cookie的对象，以便于与urllib2模块配合使用来访问Internet资源。例如可以利用本模块的CookieJar类的对象来捕获cookie并在后续连接请求时重新发送。coiokielib模块用到的对象主要有下面几个：阅读全文

posted @ 2016-12-17 17:12 Yemilice 阅读(271) 评论(0) 推荐(0) 编辑

爬虫例子及知识点（scrapy知识点）

摘要：新知识：新建一个scrapy项目：scrapy startproject xxx(项目名称）运行一个scrapy项目：scrapy crawl xxx（项目名称）项目文件说明：文件说明： • scrapy.cfg 项目的配置信息，主要为Scrapy命令行工具提供一个基础的配置信息。（真正爬虫阅读全文

posted @ 2016-12-17 17:10 Yemilice 阅读(348) 评论(0) 推荐(0) 编辑

Xpath()语法

摘要：有朋友问我正则，，okey，其实我的正则也不好，但是python下xpath是相对较简单的简单了解一下xpath： XPath 是一门在 XML 文档中查找信息的语言。XPath 可用来在 XML 文档中对元素和属性进行遍历。 XPath 是 W3C XSLT 标准的主要元素，并且 XQuery 阅读全文

posted @ 2016-12-17 17:10 Yemilice 阅读(347) 评论(0) 推荐(0) 编辑

yield和python（如何生成斐波那契數列）

摘要：您可能听说过，带有 yield 的函数在 Python 中被称之为 generator（生成器），何谓 generator ？我们先抛开 generator，以一个常见的编程题目来展示 yield 的概念。如何生成斐波那契數列斐波那契（Fibonacci）數列是一个非常简单的递归数列，除第一个阅读全文

posted @ 2016-12-17 17:08 Yemilice 阅读(580) 评论(0) 推荐(0) 编辑

Python3导入cookielib失败

摘要： Python 3 改成 http.cookiejar了，所以只要改成import http.cookiejar就自动导入cookiejar了，如果还是不行，就把所有的.pyc删掉试试。阅读全文

posted @ 2016-12-17 17:06 Yemilice 阅读(1542) 评论(0) 推荐(0) 编辑

使用Scrapy爬虫框架简单爬取图片并保存本地(妹子图）

摘要：初学Scrapy，实现爬取网络图片并保存本地功能一、先看最终效果保存在F:\pics文件夹下二、安装scrapy 1、python的安装就不说了，我用的python2.7，执行命令pip install scrapy，或者使用easy_install 命令都可以 2、可能会报如下错误 1 2 阅读全文

posted @ 2016-12-17 17:05 Yemilice 阅读(2053) 评论(0) 推荐(0) 编辑

python使用cookielib库示例分享

摘要： Python中cookielib库（python3中为http.cookiejar）为存储和管理cookie提供客户端支持,下面是使用示例该模块主要功能是提供可存储cookie的对象。使用此模块捕获cookie并在后续连接请求时重新发送，还可以用来处理包含cookie数据的文件。这个模块主要提供阅读全文

posted @ 2016-12-17 17:02 Yemilice 阅读(396) 评论(0) 推荐(0) 编辑

xpath中/和//的差别

摘要： xpath中 "/"是在子节点中查找，“//”是在所有子节点中查找，包括子节点的子节点。 example: leve1/leve2:得到文本leve2 leve1//leve2:可以得到所有leve2子节点的文本阅读全文

posted @ 2016-12-17 17:01 Yemilice 阅读(765) 评论(0) 推荐(0) 编辑

Xpath用法

摘要：在进行网页抓取的时候，分析定位html节点是获取抓取信息的关键，目前我用的是lxml模块(用来分析XML文档结构的，当然也能分析html结构)，利用其lxml.html的xpath对html进行分析，获取抓取信息;以下是关于xpath的一些基本用法: 在介绍XPath的匹配规则之前，我们先来看一些阅读全文

posted @ 2016-12-17 16:57 Yemilice 阅读(355) 评论(0) 推荐(0) 编辑