Scrapy中下载中间件

合集 - Spider爬虫(66)

1.Scrapy_ImagePipeline保存图片2023-06-24 2.Scrapy 保存数据案例-小说保存2023-06-24 3.Scrapy 中 CrawlSpider 使用(一)2023-06-24 4.Scrapy 中 CrawlSpider 使用(二)2023-06-24 5.Scrapy 中 Request 的使用2023-06-24 6.Scrapy_Request对象meta演示2023-06-25 7.Scrapy_Request对象dont_filter演示2023-06-25 8.Scrapy_Request对象Cookie的演示2023-06-25 9.Scrapy_FormRequest对象的使用2023-06-25

10.Scrapy中下载中间件2023-06-25

11.Scrapy_下载中间件设置UserAgent2023-06-25 12.Scrapy 中 Downloader 设置代理2023-06-25 13.下载中间件实战-Scrapy与Selenium结合2023-06-25 14.MongoDB介绍2023-06-25 15.Mongo_如果快速学习Mongo2023-06-25 16.Windows安装与启动MongoDB2023-06-26 17.MongoDB通过配置文件管理参数2023-06-26 18.Linux安装MongoDB2023-06-26 19.什么是Docker2023-06-26 20.为什么要使用Docker2023-06-26 21.Docker核心概念2023-06-27 22.Docker安装2023-06-27 23.Docker核心命令_镜像命令2023-06-27 24.Docker核心命令_容器命令2023-06-27 25.Docker核心命令_其他命令2023-06-27 26.Docker 安装 MongoDB2023-06-27 27.MongoDB基础命令2023-06-27 28.MongoDB数据的增加2023-06-28 29.MongoDB数据的更新2023-06-28 30.MongoDB删除文档2023-06-28 31.MongoDB数据的查询2023-06-28 32.Docker数据管理_为什么使用数据卷2023-06-28 33.Docker数据管理_配置数据卷2023-06-28 34.Docker数据管理_数据卷容器2023-06-28 35.Docker实战_Mysql数据卷挂载2023-06-28 36.MongoDB聚合操作之分组、过滤2023-06-28 37.MongoDB聚合操作之排序、分页2023-06-29 38.MongoDB索引Index2023-06-29 39.Mongo中唯一索引\复合索引2023-06-29 40.mongodb和python交互2023-06-29 41.Splash反爬2023-06-29 42.Dockerfile完全指南_什么是Dockerfile2023-06-30 43.Dockerfile完全指南_构建镜像2023-06-30 44.Dockerfile完全指南_常见的13种指令上2023-06-30 45.Docker网络管理_Docker0网络详解2023-06-30 46.Docker网络管理_四种网络模式2023-06-30 47.Docker网络管理_自定义网络2023-06-30 48.Scrapy保存数据到多个数据库2023-07-02 49.Splash与requests结合2023-07-05 50.Splash与Scrapy结合2023-07-05 51.图片验证码介绍2023-07-06 52.验证码-手动输入2023-07-06 53.超级鹰识别验证码2023-07-06 54.移动端爬虫2023-07-06 55.移动端工具的安装2023-07-06 56.模拟器配置2023-07-06 57.Appium介绍2023-07-07 58.Appium环境搭建 - Android SDK安装2023-07-07 59.Appium环境搭建 - Appium安装2023-07-07 60.appium实战2023-07-07 61.滑动验证码-保存图片2023-07-08 62.滑动验证码-获取滑动长度2023-07-08 63.滑动验证码-编辑移动轨迹2023-07-09 64.滑动验证码-移动滑块2023-07-09 65.LOL皮肤2023-07-09 66.Python调用 JS -PyExecJS, Python 调用 JS -js2py2023-07-09

Scrapy中下载中间件

下载中间件是Scrapy请求/响应处理的钩子框架。这是一个轻、低层次的应用。

通过可下载中间件，可以处理请求之前和请求之后的数据。

每个中间件组件都是一个Python类，它定义了一个或多个以下方法，我们可能需要使用方法如下：

process_request()
process_response()

process_request(self, request, spider)

当每个request通过下载中间件时，该方法被调用

必须返回以下其中之一

返回 None
- Scrapy 将继续处理该 request，执行其他的中间件的相应方法，直到合适的下载器处理函数(download handler)被调用，该 request 被执行(其 response 被下载)
返回一个 Response 对象
- Scrapy 将不会调用任何其他的 process_request()或 process_exception()方法，或相应地下载函数；其将返回该 response。已安装的中间件的 process_response()方法则会在每个 response 返回时被调用
返回一个 Request 对象
- Scrapy 则停止调用 process_request 方法并重新调度返回的 request。当新返回的 request 被执行后，相应地中间件链将会根据下载的 response 被调用
raise IgnoreRequest
- 如果抛出一个 IgnoreRequest 异常，则安装的下载中间件的 process_exception() 方法会被调用。如果没有任何一个方法处理该异常，则 request 的 errback(Request.errback)方法会被调用。如果没有代码处理抛出的异常，则该异常被忽略且不记录(不同于其他异常那样)

参数:

request (Request 对象) – 处理的request
spider (Spider 对象) – 该request对应的spider

process_response(self, request, response, spider)

当下载器完成http请求，传递响应给引擎的时候调用

process_response()应该是：返回一个 Response对象，则返回一个 Request 对象或引发 IgnoreRequest例外情况。

如果它返回 Response（可能是相同的给定响应，也可能是全新的响应），该响应将继续使用 process_response() 链中的下一个中间件
如果它返回一个 Request 对象时，中间件链将暂停，返回的请求将重新计划为将来下载。这与从返回请求的行为相同 process_request()
如果它引发了 IgnoreRequest异常，请求的errback函数 (Request.errback ）。如果没有代码处理引发的异常，则忽略该异常，不记录该异常（与其他异常不同）。
参数
- request (is a Request object) -- 发起响应的请求
- response (Responseobject) -- 正在处理的响应
- spider (Spider object) -- 此响应所针对的蜘蛛

posted @ 2023-06-25 18:06 jiang_jiayun 阅读(56) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

相关博文：

· Scrapy_下载中间件设置UserAgent

· Scrapy 中 Request 的使用

· 32、Scrapy框架_DownloadMiddleware

· python爬虫-scrapy下载中间件

· Day 24 24.1 Scrapy框架之下载中间件

阅读排行：
· 一个费力不讨好的项目，让我损失了近一半的绩效！
· 清华大学推出第四讲使用 DeepSeek + DeepResearch 让科研像聊天一样简单！
· 实操Deepseek接入个人知识库
· CSnakes vs Python.NET：高效嵌入与灵活互通的跨语言方案对比
· Plotly.NET 一个为 .NET 打造的强大开源交互式图表库

公告

昵称： jiang_jiayun
园龄： 1年8个月
粉丝： 1
关注： 0

+加关注

2025年2月

日

一

二

三

四

五

六

jiangjiayun

Scrapy中下载中间件

Scrapy中下载中间件

process_request(self, request, spider)

process_response(self, request, response, spider)

公告

搜索

常用链接

我的标签

合集

随笔档案

阅读排行榜

推荐排行榜