2019 年 3月 4 日随笔档案 - 傻白甜++

2019年3月4日

摘要：引入在通过scrapy框架进行某些网站数据爬取的时候，往往会碰到页面动态数据加载的情况发生如果直接用scrapy对其url发请求，是获取不到那部分动态加载出来的数据值，但是通过观察会发现，通过浏览器进行url请求发送则会加载出对应的动态加载的数据。那么如果我们想要在scrapy也获取动态加载出的数阅读全文

posted @ 2019-03-04 16:25 傻白甜++ 阅读(606) 评论(0) 推荐(0) 编辑

14，UA池和代理池

摘要：今日概要 scrapy下载中间件 UA池代理池一，下载中间件（Downloader Middlewares）位于scrapy引擎和下载器之间的一层组件。 - 作用：（1）引擎将请求传递给下载器过程中，下载中间件可以对请求进行一系列处理。比如设置请求的User-Agent，设置代理等；（2）阅读全文

posted @ 2019-03-04 15:58 傻白甜++ 阅读(259) 评论(0) 推荐(0) 编辑

13，scrapy框架的日志等级和请求传参

摘要：今日概要日志等级请求传参如何提高scrapy的爬取效率一.Scrapy的日志等级 - 在使用scrapy crawl spiderFileName运行程序时，在终端里打印输出的就是scrapy的日志信息。 - 日志信息的种类： ERROR ：一般错误 WARNING : 警告 INFO : 阅读全文

posted @ 2019-03-04 15:35 傻白甜++ 阅读(252) 评论(0) 推荐(0) 编辑

12，scrapy框架之post请求

摘要：今日概要递归爬取解析多页页面数据 scrapy的post请求发送递归爬取解析多页页面数据 scrapy的post请求发送 1.递归爬取解析多页页面数据 - 需求：将糗事百科所有页码的作者和段子内容数据进行爬取切持久化存储 - 需求分析：每一个页面对应一个url，则scrapy工程需要对每一个页码阅读全文

posted @ 2019-03-04 15:19 傻白甜++ 阅读(518) 评论(0) 推荐(0) 编辑

bobby

东方之东有日出，西方之西有海洋，东方西方漫游的渴望，再也不容许我彷徨。

公告