林贵秀

2017年7月30日

第三百三十四节，web爬虫讲解2—Scrapy框架爬虫—Scrapy爬取百度新闻，爬取Ajax动态生成的信息

摘要：第三百三十四节，web爬虫讲解2—Scrapy框架爬虫—Scrapy爬取百度新闻，爬取Ajax动态生成的信息 crapy爬取百度新闻，爬取Ajax动态生成的信息，抓取百度新闻首页的新闻rul地址有多网站，当你浏览器访问时看到的信息，在html源文件里却找不到，由得信息还是滚动条滚动到对应的位置后才阅读全文

posted @ 2017-07-30 01:37 林贵秀阅读(3953) 评论(0) 推荐(0) 编辑

2017年7月29日

第三百三十三节，web爬虫讲解2—Scrapy框架爬虫—Scrapy模拟浏览器登录—获取Scrapy框架Cookies

摘要：第三百三十三节，web爬虫讲解2—Scrapy框架爬虫—Scrapy模拟浏览器登录模拟浏览器登录 start_requests()方法，可以返回一个请求给爬虫的起始网站，这个返回的请求相当于start_urls，start_requests()返回的请求会替代start_urls里的请求 Requ 阅读全文

posted @ 2017-07-29 15:30 林贵秀阅读(14191) 评论(0) 推荐(1) 编辑

2017年7月28日

第三百三十二节，web爬虫讲解2—Scrapy框架爬虫—Scrapy使用

摘要：第三百三十二节，web爬虫讲解2—Scrapy框架爬虫—Scrapy使用 xpath表达式 //x 表示向下查找n层指定标签，如：//div 表示查找所有div标签 /x 表示向下查找一层指定的标签 /@x 表示查找指定属性的值,可以连缀如：@id @src [@属性名称="属性值"]表示查找指定属阅读全文

posted @ 2017-07-28 16:15 林贵秀阅读(739) 评论(0) 推荐(0) 编辑

第三百三十一节，web爬虫讲解2—Scrapy框架爬虫—Scrapy安装—Scrapy指令

摘要：第三百三十一节，web爬虫讲解2—Scrapy框架爬虫—Scrapy安装—Scrapy指令 Scrapy框架安装 1、首先，终端执行命令升级pip: python -m pip install --upgrade pip2、安装，wheel(建议网络安装) pip install wheel3、安装阅读全文

posted @ 2017-07-28 03:47 林贵秀阅读(669) 评论(0) 推荐(0) 编辑

2017年7月27日

第三百三十节，web爬虫讲解2—urllib库爬虫—实战爬取搜狗微信公众号—抓包软件安装Fiddler4讲解

摘要：第三百三十节，web爬虫讲解2—urllib库爬虫—实战爬取搜狗微信公众号—抓包软件安装Fiddler4讲解封装模块实战爬取搜狗微信公众号抓包教程首先安装Fiddler4 软件界面说明清除请求设置抓包浏览器这样设置好后，这个浏览器访问的网址就会在抓包软件里看到信息了设置抓取https 阅读全文

posted @ 2017-07-27 20:15 林贵秀阅读(1149) 评论(0) 推荐(0) 编辑

2017年7月26日

第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理—用户代理和ip代理结合应用

摘要：第三百二十九节，web爬虫讲解2—urllib库爬虫—ip代理使用IP代理 ProxyHandler()格式化IP，第一个参数，请求目标可能是http或者https,对应设置build_opener()初始化IPinstall_opener()将代理IP设置成全局,当使用urlopen()请求时自阅读全文

posted @ 2017-07-26 22:11 林贵秀阅读(375) 评论(0) 推荐(0) 编辑

第三百二十八节，web爬虫讲解2—urllib库爬虫—状态吗—异常处理—浏览器伪装技术、设置用户代理

摘要：第三百二十八节，web爬虫讲解2—urllib库爬虫—状态吗—异常处理—浏览器伪装技术、设置用户代理如果爬虫没有异常处理，那么爬行中一旦出现错误，程序将崩溃停止工作，有异常处理即使出现错误也能继续执行下去 1.常见状态吗 301：重定向到新的URL，永久性302：重定向到临时URL，非永久性304 阅读全文

posted @ 2017-07-26 17:09 林贵秀阅读(362) 评论(0) 推荐(0) 编辑

2017年7月25日

第三百二十七节，web爬虫讲解2—urllib库爬虫—基础使用—超时设置—自动模拟http请求

摘要：第三百二十七节，web爬虫讲解2—urllib库爬虫利用python系统自带的urllib库写简单爬虫 urlopen()获取一个URL的html源码read()读出html源码内容decode("utf-8")将字节转化成字符串正则获取页面指定内容 urlretrieve()将网络文件下载保存阅读全文

posted @ 2017-07-25 19:08 林贵秀阅读(365) 评论(0) 推荐(0) 编辑

第三百二十六节，web爬虫，scrapy模块,解决重复ur——自动递归url

摘要：第三百二十六节，web爬虫，scrapy模块,解决重复url——自动递归url 一般抓取过的url不重复抓取，那么就需要记录url，判断当前URL如果在记录里说明已经抓取过了，如果不存在说明没抓取过记录url可以是缓存，或者数据库，如果保存数据库按照以下方式： id URL加密(建索引以便查询) 阅读全文

posted @ 2017-07-25 11:52 林贵秀阅读(1722) 评论(0) 推荐(0) 编辑

2017年7月24日

第三百二十五节，web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签

摘要：第三百二十五节，web爬虫，scrapy模块标签选择器下载图片，以及正则匹配标签标签选择器对象 HtmlXPathSelector()创建标签选择器对象，参数接收response回调的html对象需要导入模块：from scrapy.selector import HtmlXPathSelecto 阅读全文

posted @ 2017-07-24 21:14 林贵秀阅读(652) 评论(1) 推荐(0) 编辑

开始Python之旅

公告