Scrapy_Request对象dont_filter演示

合集 - Spider爬虫(66)

1.Scrapy_ImagePipeline保存图片2023-06-24 2.Scrapy 保存数据案例-小说保存2023-06-24 3.Scrapy 中 CrawlSpider 使用(一)2023-06-24 4.Scrapy 中 CrawlSpider 使用(二)2023-06-24 5.Scrapy 中 Request 的使用2023-06-24 6.Scrapy_Request对象meta演示2023-06-25

7.Scrapy_Request对象dont_filter演示2023-06-25

8.Scrapy_Request对象Cookie的演示2023-06-25 9.Scrapy_FormRequest对象的使用2023-06-25 10.Scrapy中下载中间件2023-06-25 11.Scrapy_下载中间件设置UserAgent2023-06-25 12.Scrapy 中 Downloader 设置代理2023-06-25 13.下载中间件实战-Scrapy与Selenium结合2023-06-25 14.MongoDB介绍2023-06-25 15.Mongo_如果快速学习Mongo2023-06-25 16.Windows安装与启动MongoDB2023-06-26 17.MongoDB通过配置文件管理参数2023-06-26 18.Linux安装MongoDB2023-06-26 19.什么是Docker2023-06-26 20.为什么要使用Docker2023-06-26 21.Docker核心概念2023-06-27 22.Docker安装2023-06-27 23.Docker核心命令_镜像命令2023-06-27 24.Docker核心命令_容器命令2023-06-27 25.Docker核心命令_其他命令2023-06-27 26.Docker 安装 MongoDB2023-06-27 27.MongoDB基础命令2023-06-27 28.MongoDB数据的增加2023-06-28 29.MongoDB数据的更新2023-06-28 30.MongoDB删除文档2023-06-28 31.MongoDB数据的查询2023-06-28 32.Docker数据管理_为什么使用数据卷2023-06-28 33.Docker数据管理_配置数据卷2023-06-28 34.Docker数据管理_数据卷容器2023-06-28 35.Docker实战_Mysql数据卷挂载2023-06-28 36.MongoDB聚合操作之分组、过滤2023-06-28 37.MongoDB聚合操作之排序、分页2023-06-29 38.MongoDB索引Index2023-06-29 39.Mongo中唯一索引\复合索引2023-06-29 40.mongodb和python交互2023-06-29 41.Splash反爬2023-06-29 42.Dockerfile完全指南_什么是Dockerfile2023-06-30 43.Dockerfile完全指南_构建镜像2023-06-30 44.Dockerfile完全指南_常见的13种指令上2023-06-30 45.Docker网络管理_Docker0网络详解2023-06-30 46.Docker网络管理_四种网络模式2023-06-30 47.Docker网络管理_自定义网络2023-06-30 48.Scrapy保存数据到多个数据库2023-07-02 49.Splash与requests结合2023-07-05 50.Splash与Scrapy结合2023-07-05 51.图片验证码介绍2023-07-06 52.验证码-手动输入2023-07-06 53.超级鹰识别验证码2023-07-06 54.移动端爬虫2023-07-06 55.移动端工具的安装2023-07-06 56.模拟器配置2023-07-06 57.Appium介绍2023-07-07 58.Appium环境搭建 - Android SDK安装2023-07-07 59.Appium环境搭建 - Appium安装2023-07-07 60.appium实战2023-07-07 61.滑动验证码-保存图片2023-07-08 62.滑动验证码-获取滑动长度2023-07-08 63.滑动验证码-编辑移动轨迹2023-07-09 64.滑动验证码-移动滑块2023-07-09 65.LOL皮肤2023-07-09 66.Python调用 JS -PyExecJS, Python 调用 JS -js2py2023-07-09

import scrapy


class BaiduSpider(scrapy.Spider):
    name = "baidu"
    allowed_domains = ["baidu.com"]
    start_urls = ["https://baidu.com"]

    def parse(self, response):
        title = response.xpath('//title/text()').get()
        print(title)
        yield scrapy.Request('https://baidu.com',callback=self.parse_info)

    def parse_info(self, response):
        title = response.xpath('//title/text()').get()
        print(title)
        yield scrapy.Request('https://baidu.com',callback=self.parse_info)

理论上是死循环

默认去重

import scrapy


class BaiduSpider(scrapy.Spider):
    name = "baidu"
    allowed_domains = ["baidu.com"]
    start_urls = ["https://baidu.com"]

    def start_requests(self):
        for url in self.start_urls:
            # dont_filter:取消去重    True继续访问，Falsa取消访问
            yield scrapy.Request(url, dont_filter=True)
    
    def parse(self, response):
        title = response.xpath('//title/text()').get()
        print(title)
        yield scrapy.Request('https://baidu.com',callback=self.parse_info)

    def parse_info(self, response):
        title = response.xpath('//title/text()').get()
        print(title)
        yield scrapy.Request('https://baidu.com',callback=self.parse_info)

posted @ 2023-06-25 15:14 jiang_jiayun 阅读(172) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

相关博文：

· Scrapy_Request对象Cookie的演示

· Scrapy_Request对象meta演示

· scrapy 的post请求

· 爬虫_scrapy_post请求

· scrapy post请求练习

阅读排行：
· 一个费力不讨好的项目，让我损失了近一半的绩效！
· 清华大学推出第四讲使用 DeepSeek + DeepResearch 让科研像聊天一样简单！
· 实操Deepseek接入个人知识库
· CSnakes vs Python.NET：高效嵌入与灵活互通的跨语言方案对比
· Plotly.NET 一个为 .NET 打造的强大开源交互式图表库

公告

昵称： jiang_jiayun
园龄： 1年8个月
粉丝： 1
关注： 0

+加关注

2025年2月

日

一

二

三

四

五

六

jiangjiayun

Scrapy_Request对象dont_filter演示

公告

搜索

常用链接

我的标签

合集

随笔档案

阅读排行榜

推荐排行榜