下载中间件实战-Scrapy与Selenium结合

合集 - Spider爬虫(66)

1.Scrapy_ImagePipeline保存图片2023-06-24 2.Scrapy 保存数据案例-小说保存2023-06-24 3.Scrapy 中 CrawlSpider 使用(一)2023-06-24 4.Scrapy 中 CrawlSpider 使用(二)2023-06-24 5.Scrapy 中 Request 的使用2023-06-24 6.Scrapy_Request对象meta演示2023-06-25 7.Scrapy_Request对象dont_filter演示2023-06-25 8.Scrapy_Request对象Cookie的演示2023-06-25 9.Scrapy_FormRequest对象的使用2023-06-25 10.Scrapy中下载中间件2023-06-25 11.Scrapy_下载中间件设置UserAgent2023-06-25 12.Scrapy 中 Downloader 设置代理2023-06-25

13.下载中间件实战-Scrapy与Selenium结合2023-06-25

14.MongoDB介绍2023-06-25 15.Mongo_如果快速学习Mongo2023-06-25 16.Windows安装与启动MongoDB2023-06-26 17.MongoDB通过配置文件管理参数2023-06-26 18.Linux安装MongoDB2023-06-26 19.什么是Docker2023-06-26 20.为什么要使用Docker2023-06-26 21.Docker核心概念2023-06-27 22.Docker安装2023-06-27 23.Docker核心命令_镜像命令2023-06-27 24.Docker核心命令_容器命令2023-06-27 25.Docker核心命令_其他命令2023-06-27 26.Docker 安装 MongoDB2023-06-27 27.MongoDB基础命令2023-06-27 28.MongoDB数据的增加2023-06-28 29.MongoDB数据的更新2023-06-28 30.MongoDB删除文档2023-06-28 31.MongoDB数据的查询2023-06-28 32.Docker数据管理_为什么使用数据卷2023-06-28 33.Docker数据管理_配置数据卷2023-06-28 34.Docker数据管理_数据卷容器2023-06-28 35.Docker实战_Mysql数据卷挂载2023-06-28 36.MongoDB聚合操作之分组、过滤2023-06-28 37.MongoDB聚合操作之排序、分页2023-06-29 38.MongoDB索引Index2023-06-29 39.Mongo中唯一索引\复合索引2023-06-29 40.mongodb和python交互2023-06-29 41.Splash反爬2023-06-29 42.Dockerfile完全指南_什么是Dockerfile2023-06-30 43.Dockerfile完全指南_构建镜像2023-06-30 44.Dockerfile完全指南_常见的13种指令上2023-06-30 45.Docker网络管理_Docker0网络详解2023-06-30 46.Docker网络管理_四种网络模式2023-06-30 47.Docker网络管理_自定义网络2023-06-30 48.Scrapy保存数据到多个数据库2023-07-02 49.Splash与requests结合2023-07-05 50.Splash与Scrapy结合2023-07-05 51.图片验证码介绍2023-07-06 52.验证码-手动输入2023-07-06 53.超级鹰识别验证码2023-07-06 54.移动端爬虫2023-07-06 55.移动端工具的安装2023-07-06 56.模拟器配置2023-07-06 57.Appium介绍2023-07-07 58.Appium环境搭建 - Android SDK安装2023-07-07 59.Appium环境搭建 - Appium安装2023-07-07 60.appium实战2023-07-07 61.滑动验证码-保存图片2023-07-08 62.滑动验证码-获取滑动长度2023-07-08 63.滑动验证码-编辑移动轨迹2023-07-09 64.滑动验证码-移动滑块2023-07-09 65.LOL皮肤2023-07-09 66.Python调用 JS -PyExecJS, Python 调用 JS -js2py2023-07-09

下载中间件实战-Scrapy与Selenium结合

有的页面反爬技术比较高端，一时破解不了，这时我们就是可以考虑使用selenium来降低爬取的难度。

问题来了，如何将Scrapy与Selenium结合使用呢？

思考的思路： 只是用Selenium来帮助下载数据。因此可以考虑通过下载中间件来处理这块内容。

Spider文件

@classmethod
 def from_crawler(cls, crawler, *args, **kwargs):
    spider = super(BaiduSpider, cls).from_crawler(crawler, *args, **kwargs)
    spider.chrome = webdriver.Chrome(executable_path='../tools/chromedriver.exe')
    crawler.signals.connect(spider.spider_closed, signal=signals.spider_closed) 
    # connect里的参数 
    # 1. 处罚事件后用哪个函数处理
    # 2. 捕捉哪个事件
    return spider




  def spider_closed(self, spider):
    spider.chrome.close()

middlewares文件

def process_request(self, request, spider): 
    spider.chrome.get(request.url)
    html = spider.chrome.page_source
    return HtmlResponse(url = request.url,body = html,request = request,encoding='utf-8')

posted @ 2023-06-25 20:13 jiang_jiayun 阅读(113) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

相关博文：

· Scrapy中下载中间件

· Splash与Scrapy结合

· 数据采集与融合技术实践--作业三

· scrapy中selenium的应用

阅读排行：
· 一个费力不讨好的项目，让我损失了近一半的绩效！
· 清华大学推出第四讲使用 DeepSeek + DeepResearch 让科研像聊天一样简单！
· 实操Deepseek接入个人知识库
· CSnakes vs Python.NET：高效嵌入与灵活互通的跨语言方案对比
· Plotly.NET 一个为 .NET 打造的强大开源交互式图表库

公告

昵称： jiang_jiayun
园龄： 1年8个月
粉丝： 1
关注： 0

+加关注

2025年2月

日

一

二

三

四

五

六

jiangjiayun

下载中间件实战-Scrapy与Selenium结合

下载中间件实战-Scrapy与Selenium结合

公告

搜索

常用链接

我的标签

合集

随笔档案

阅读排行榜

推荐排行榜