scrapy架构介绍、scrapy解析数据、scrapy解析数据、持久化方案、全站爬取cnblogs文章、爬虫和下载中间件、加代理，cookie，header，加入selenium

0 scrapy架构介绍
- 0.1 scrapy的一些命令
- 0.2 scrapy项目目录结构
1 scrapy解析数据
- 解析cnblosg
2 settings相关配置，提高爬取效率
- 2.1 基础的一些
- 2.2 增加爬虫的爬取效率
3 持久化方案
4 全站爬取cnblogs文章
- 4.1 request和response对象传递参数
- 4.2 解析下一页并继续爬取
5 爬虫和下载中间件
6 加代理，cookie，header，加入selenium

 # 1 selenium
	-登录cnblogs，拿到cookie，再打开cnblogs，写入cookie，它就是登录状态
    
    -半自动点赞---》selenium生成的cookie，给requests用
    	-selenium操作浏览器，速度慢
        -requests速度快
        
    -动作链
    -自动登录12306
# 2 打码平台
	-帮我们破解验证码---》超级鹰，云打码
    -验证码图片，发送给破解平台，把结果给你，你输入进去
    -获取到验证码图片
    	-1 截图
        -2 如果图片用base64编码的，直接保存到本地即可
        
        
    -使用打码平台，登录打码平台
    
    
# 3 xpath的使用
	- /
    - //
    -.
    -..
    -标签名字
    -@属性名
 
    
# 4 scrapy框架

0 scrapy架构介绍

 # 引擎(EGINE)
引擎负责控制系统所有组件之间的数据流，并在某些动作发生时触发事件。
 
# 调度器(SCHEDULER)
用来接受引擎发过来的请求, 压入队列中, 并在引擎再次请求的时候返回. 可以想像成一个URL的优先级队列, 由它来决定下一个要抓取的网址是什么, 同时去除重复的网址
 
# 下载器(DOWLOADER)
用于下载网页内容, 并将网页内容返回给EGINE，下载器是建立在twisted这个高效的异步模型上的
 
# 爬虫(SPIDERS)--->在这里写代码
SPIDERS是开发人员自定义的类，用来解析responses，并且提取items，或者发送新的请求
 
# 项目管道(ITEM PIPLINES)
在items被提取后负责处理它们，主要包括清理、验证、持久化（比如存到数据库）等操作
 
# 下载器中间件(Downloader Middlewares)
 
位于Scrapy引擎和下载器之间，主要用来处理从EGINE传到DOWLOADER的请求request，已经从DOWNLOADER传到EGINE的响应response，你可用该中间件做以下几件事：设置请求头，设置cookie，使用代理，集成selenium
 
# 爬虫中间件(Spider Middlewares)
位于EGINE和SPIDERS之间，主要工作是处理SPIDERS的输入（即responses）和输出（即requests）

0.1 scrapy的一些命令

 # 安装完成后，会有scrapy的可执行文件
 
# 创建项目
	scrapy startproject 项目名字  # 跟创建django一样，pycharm能直接创建django
    
    
# 创建爬虫
	scrapy genspider 名字 域名   # 创建爬虫  django的创建app
    
# pycharm打开scrapy的项目
 
 
# 运行爬虫
	scrapy crawl 爬虫名字
    
# 想点击绿色箭头运行爬虫
	新建一个run.py,写入，以后右键执行即可
    from scrapy.cmdline import execute
    execute(['scrapy','crawl','cnblogs','--nolog'])
    
    
    
# 补充：爬虫协议
 http://www.cnblogs.com/robots.txt

0.2 scrapy项目目录结构

 firstscrapy 						# 项目名
    firstscrapy            # 文件夹名字，核心代码，都在这里面
    	spiders            # 爬虫的文件，里面有所有的爬虫
        	__init__.py
        	baidu.py      # 百度爬虫 
        	cnblogs.py    #cnblogs爬虫
        items.py # 有很多模型类---》以后存储的数据，都做成模型类的对象，等同于django的models.py
        middlewares.py # 中间件：爬虫中间件，下载中间件都写在这里面
        pipelines.py   #项目管道---》以后写持久化，都在这里面写
        run.py         # 自己写的，运行爬虫
        settings.py    # 配置文件  django的配置文件
   scrapy.cfg          # 项目上线用的，不需要关注

1 scrapy解析数据

 1 response对象有css方法和xpath方法
	-css中写css选择器
    -xpath中写xpath选择
2 重点1：
	-xpath取文本内容
	'.//a[contains(@class,"link-title")]/text()'
    -xpath取属性
    './/a[contains(@class,"link-title")]/@href'
    -css取文本
    'a.link-title::text'
    -css取属性
    'img.image-scale::attr(src)'
3 重点2：
	.extract_first()  取一个
    .extract()        取所有

解析cnblosg

     # def parse(self, response):
    #     # 解析数据 css解析
    #     article_list = response.css('article.post-item')
    #     for article in article_list:
    #         title = article.css('div.post-item-text>a::text').extract_first()
    #         author_img = article.css('div.post-item-text img::attr(src)').extract_first()
    #         author_name = article.css('footer span::text').extract_first()
    #         desc_old = article.css('p.post-item-summary::text').extract()
    #         desc = desc_old[0].replace('\n', '').replace(' ', '')
    #         if not desc:
    #             desc = desc_old[1].replace('\n', '').replace(' ', '')
    #         url=article.css('div.post-item-text>a::attr(href)').extract_first()
    #         # 文章真正的内容，没拿到，它不在这个页面中，它在下一个页面中
    #         print(title)
    #         print(author_img)
    #         print(author_name)
    #         print(desc)
    #         print(url)
 
    def parse(self, response):
        # 解析数据 css解析
        article_list = response.xpath('//*[@id="post_list"]/article')
        # article_list = response.xpath('//article[contains(@class,"post-item")]')
        for article in article_list:
            title = article.xpath('.//div/a/text()').extract_first()
            author_img = article.xpath('.//div//img/@src').extract_first()
            author_name = article.xpath('.//footer//span/text()').extract_first()
            desc_old = article.xpath('.//p/text()').extract()
            desc = desc_old[0].replace('\n', '').replace(' ', '')
            if not desc:
                desc = desc_old[1].replace('\n', '').replace(' ', '')
            url = article.xpath('.//div/a/@href').extract_first()
            # 文章真正的内容，没拿到，它不在这个页面中，它在下一个页面中
            print(title)
            print(author_img)
            print(author_name)
            print(desc)
            print(url)

2 settings相关配置，提高爬取效率

 # scrapy 项目有项目自己的配置文件，还有内置的

2.1 基础的一些

 #1 了解
BOT_NAME = "firstscrapy"  #项目名字，整个爬虫名字
#2 爬虫存放位置    了解
SPIDER_MODULES = ["firstscrapy.spiders"]
NEWSPIDER_MODULE = "firstscrapy.spiders"
 
#3  记住 是否遵循爬虫协议，一般都设为False
ROBOTSTXT_OBEY = False
# 4 记住
USER_AGENT = "firstscrapy (+http://www.yourdomain.com)"
#5  记住  日志级别
LOG_LEVEL='ERROR'
 
#6   记住 DEFAULT_REQUEST_HEADERS 默认请求头
DEFAULT_REQUEST_HEADERS = {
   'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
   'Accept-Language': 'en',
}
 
#7 记住 后面学  SPIDER_MIDDLEWARES 爬虫中间件
SPIDER_MIDDLEWARES = {
    'cnblogs.middlewares.CnblogsSpiderMiddleware': 543,
}
#8 后面学 DOWNLOADER_MIDDLEWARES  下载中间件
DOWNLOADER_MIDDLEWARES = {
    'cnblogs.middlewares.CnblogsDownloaderMiddleware': 543,
}
 
#9 后面学 ITEM_PIPELINES 持久化配置
ITEM_PIPELINES = {
    'cnblogs.pipelines.CnblogsPipeline': 300,
}

2.2 增加爬虫的爬取效率

 #1 增加并发：默认16
默认scrapy开启的并发线程为32个，可以适当进行增加。在settings配置文件中修改
CONCURRENT_REQUESTS = 100
值为100,并发设置成了为100。
#2 降低日志级别：
在运行scrapy时，会有大量日志信息的输出，为了减少CPU的使用率。可以设置log输出信息为INFO或者ERROR即可。在配置文件中编写：
LOG_LEVEL = 'INFO'
# 3 禁止cookie：
如果不是真的需要cookie，则在scrapy爬取数据时可以禁止cookie从而减少CPU的使用率，提升爬取效率。在配置文件中编写：
COOKIES_ENABLED = False
# 4 禁止重试：
对失败的HTTP进行重新请求（重试）会减慢爬取速度，因此可以禁止重试。在配置文件中编写：
RETRY_ENABLED = False
# 5 减少下载超时：
如果对一个非常慢的链接进行爬取，减少下载超时可以能让卡住的链接快速被放弃，从而提升效率。在配置文件中进行编写：
DOWNLOAD_TIMEOUT = 10 超时时间为10s

3 持久化方案

 # 方式一：（parse必须有return值，必须是列表套字典形式--->使用命令，可以保存到json格式中，csv中。。。）
scrapy crawl cnblogs -o cnbogs.json
 
# 方式二：我们用的，使用pipline存储---》可以存到多个位置
	-第一步：在item.py中写一个类
        class FirstscrapyItem(scrapy.Item):
            title = scrapy.Field()
            author_img = scrapy.Field()
            author_name = scrapy.Field()
            desc = scrapy.Field()
            url = scrapy.Field()
            # 博客文章内容，但是暂时没有
            content = scrapy.Field()
            
    -第二步：在pipline.py中写代码，写一个类：open_spide,close_spider，process_item
    	-open_spide：开启爬虫会触发
    	-close_spider：爬完会触发
        -process_ite:每次要保存一个对象会触发
        class FirstscrapyFilePipeline:
            def open_spider(self, spider):
                print('我开了')
                self.f=open('a.txt','w',encoding='utf-8')
            def close_spider(self, spider):
                print('我关了')
                self.f.close()
            # 这个很重要
            def process_item(self, item, spider):
                self.f.write(item['title']+'\n')
                return item
    -第三步：配置文件配置
    	ITEM_PIPELINES = {
           "firstscrapy.pipelines.FirstscrapyFilePipeline": 300,  # 数字越小，优先级越高
        }
        
    -第四步：在解析方法parse中yield item对象

4 全站爬取cnblogs文章

4.1 request和response对象传递参数

 # Request创建：在parse中，for循环中，创建Request对象时，传入meta
	yield Request(url=url, callback=self.detail_parse,meta={'item':item})
    
# Response对象：detail_parse中，通过response取出meta取出item，把文章详情写入
	yield item

4.2 解析下一页并继续爬取

 import scrapy
from bs4 import BeautifulSoup
from firstscrapy.items import FirstscrapyItem
from scrapy.http.request import Request
 
class CnblogsSpider(scrapy.Spider):
    name = "cnblogs"
    allowed_domains = ["www.cnblogs.com"]
    start_urls = ["http://www.cnblogs.com/"]
 
    # 解析出下一页地址，继续爬取
    def parse(self, response):
        article_list = response.xpath('//*[@id="post_list"]/article')
        # article_list = response.xpath('//article[contains(@class,"post-item")]')
        # l=[]
        for article in article_list:
            item = FirstscrapyItem()
            title = article.xpath('.//div/a/text()').extract_first()
            item['title'] = title
            author_img = article.xpath('.//div//img/@src').extract_first()
            item['author_img'] = author_img
            author_name = article.xpath('.//footer//span/text()').extract_first()
            item['author_name'] = author_name
            desc_old = article.xpath('.//p/text()').extract()
            desc = desc_old[0].replace('\n', '').replace(' ', '')
            if not desc:
                desc = desc_old[1].replace('\n', '').replace(' ', '')
            item['desc'] = desc
            url = article.xpath('.//div/a/@href').extract_first()
            item['url'] = url
            # print(title)
            # yield item对象 不完整，缺文章的content，而文章的content在下一个页面中,而此处要yield一个Request对象
            # yield item
            yield Request(url=url,callback=self.parser_detail,meta={'item':item}) # 爬完后执行的解析方法
 
 
        next='https://www.cnblogs.com'+response.css('div.pager>a:last-child::attr(href)').extract_first()
        print(next) # 继续爬取
        yield Request(url=next,callback=self.parse)
 
 
 
    # 解析详情的方法
    def parser_detail(self,response):
        # print(response.status)
        # 解析出文章内容
        content=response.css('#cnblogs_post_body').extract_first()
        # print(str(content))
        # 如何放到item中
        item=response.meta.get('item')
        if content:
            item['content']=content
        else:
            item['content'] = '没查到'
        yield item

5 爬虫和下载中间件

6 加代理，cookie，header，加入selenium

6.1 加代理

6.2 加cookie,修改请求头，随机生成UserAgent

6.3 集成selenium

 #1  面试官要看你项目
	- 编码水平
    - 公司的看不了，给他看的，全是个人项目
    - 公司项目看不了，签了保密协议
    
    
#2  数据库如何处理的？
	-云数据库：阿里云数据库，花钱，买服务---》账号和密码---》公司不需要自己搭建mysql
    	-mysql
        -redis
        -mongodb
    -自己的数据库，部署在云服务器上的数据库，是你自己的
    
    
# 3 你用过什么云产品？
	- 阿里云的ecs，服务器
    - 阿里云的oss ，对象存储
    - 云短信
    - 七牛云 文件存储
    
    
# 4 看看你的数据库
	-配置文件 dev.py  连的是本地127.0.0.1
    -你们上线怎么弄
    	-我不知道，就是给我一个地址，端口，用户名密码
        
    - 上线的数据库服务和项目服务 是在同一台及其上吗？
 
# 5 celery用过
	定时任务
    定时
    异步任务
    
    
    
# 6 多线程用过
	-用过
    -怎么用的？两种方式
    	-类实例化得到对象Thread类 传入target 任务函数，对象.start
        -写一个类，继承Thread，重写run方法，写任务  类实例化得到对象  对象.start
    -如果io密集型，用多线程，计算密集型用多进程 ---》只针对于cpython
    
    
# 7 mysql 用过，索引你知道吗？
	唯一索引和联合索引有什么区别
    
    
#8 1千万w，性别字段(男女)，查询时候，这个字段要不要加索引
	-因为它就两种状态，建立索引是没用的，即便建立索引，也不会走
    
    
 
 
# 9 实现踢下线
	-session机制---》表中把它那条记录删除
    -token机制----》
    	-下线人id----》放个位置
        -进入到认证类中---》
 
# 10 实现黑名单功能
	-建立个黑名单表
    	-id  用户id ，ip，时间。。。

posted @ 2023-03-21 19:24 冰柠檬檬阅读(56) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

· selenium 登录cnblogs、抽屉半自动点赞、xpath的使用、selenium 动作链、自动登录12306、打码平台使用、使用打码平台自动登录、使用selenium爬取京东商品信息、scrapy介绍

· scrapy架构介绍、scrapy解析数据、settings相关配置、持久化方案

· 爬虫----day05（）

· 0 scrapy架构介绍、1 scrapy解析数据、2 settings相关配置，提高爬取效率、3 持久化方案、 4 全站爬取cnblogs文章

阅读排行：
· 10年+ .NET Coder 心语 ── 封装的思维：从隐藏、稳定开始理解其本质意义
· 地球OL攻略 —— 某应届生求职总结
· 提示词工程——AI应用必不可少的技术
· Open-Sora 2.0 重磅开源！
· 周边上新：园子的第一款马克杯温暖上架

公告

昵称：冰柠檬檬
园龄： 2年5个月
粉丝： 0
关注： 4

+加关注

2025年3月

日

一

二

三

四

五

六

随笔分类

flask(6)

bnmm

scrapy架构介绍、scrapy解析数据、scrapy解析数据、持久化方案、全站爬取cnblogs文章、爬虫和下载中间件、加代理，cookie，header，加入selenium

0 scrapy架构介绍

0.1 scrapy的一些命令

0.2 scrapy项目目录结构

1 scrapy解析数据

解析cnblosg

2 settings相关配置，提高爬取效率

2.1 基础的一些

2.2 增加爬虫的爬取效率

3 持久化方案

4 全站爬取cnblogs文章

4.1 request和response对象传递参数

4.2 解析下一页并继续爬取

5 爬虫和下载中间件

6 加代理，cookie，header，加入selenium

6.1 加代理

6.2 加cookie,修改请求头，随机生成UserAgent

6.3 集成selenium

公告

搜索

常用链接

随笔分类

随笔档案

阅读排行榜

	# 1 selenium
	-登录cnblogs，拿到cookie，再打开cnblogs，写入cookie，它就是登录状态

	-半自动点赞---》selenium生成的cookie，给requests用
	-selenium操作浏览器，速度慢
	-requests速度快

	-动作链
	-自动登录12306
	# 2 打码平台
	-帮我们破解验证码---》超级鹰，云打码
	-验证码图片，发送给破解平台，把结果给你，你输入进去
	-获取到验证码图片
	-1 截图
	-2 如果图片用base64编码的，直接保存到本地即可


	-使用打码平台，登录打码平台


	# 3 xpath的使用
	- /
	- //
	-.
	-..
	-标签名字
	-@属性名


	# 4 scrapy框架

	# 引擎(EGINE)
	引擎负责控制系统所有组件之间的数据流，并在某些动作发生时触发事件。

	# 调度器(SCHEDULER)
	用来接受引擎发过来的请求, 压入队列中, 并在引擎再次请求的时候返回. 可以想像成一个URL的优先级队列, 由它来决定下一个要抓取的网址是什么, 同时去除重复的网址

	# 下载器(DOWLOADER)
	用于下载网页内容, 并将网页内容返回给EGINE，下载器是建立在twisted这个高效的异步模型上的

	# 爬虫(SPIDERS)--->在这里写代码
	SPIDERS是开发人员自定义的类，用来解析responses，并且提取items，或者发送新的请求

	# 项目管道(ITEM PIPLINES)
	在items被提取后负责处理它们，主要包括清理、验证、持久化（比如存到数据库）等操作

	# 下载器中间件(Downloader Middlewares)

	位于Scrapy引擎和下载器之间，主要用来处理从EGINE传到DOWLOADER的请求request，已经从DOWNLOADER传到EGINE的响应response，你可用该中间件做以下几件事：设置请求头，设置cookie，使用代理，集成selenium

	# 爬虫中间件(Spider Middlewares)
	位于EGINE和SPIDERS之间，主要工作是处理SPIDERS的输入（即responses）和输出（即requests）

	# 安装完成后，会有scrapy的可执行文件

	# 创建项目
	scrapy startproject 项目名字 # 跟创建django一样，pycharm能直接创建django


	# 创建爬虫
	scrapy genspider 名字域名 # 创建爬虫 django的创建app

	# pycharm打开scrapy的项目


	# 运行爬虫
	scrapy crawl 爬虫名字

	# 想点击绿色箭头运行爬虫
	新建一个run.py,写入，以后右键执行即可
	from scrapy.cmdline import execute
	execute(['scrapy','crawl','cnblogs','--nolog'])



	# 补充：爬虫协议
	http://www.cnblogs.com/robots.txt

	firstscrapy # 项目名
	firstscrapy # 文件夹名字，核心代码，都在这里面
	spiders # 爬虫的文件，里面有所有的爬虫
	__init__.py
	baidu.py # 百度爬虫
	cnblogs.py #cnblogs爬虫
	items.py # 有很多模型类---》以后存储的数据，都做成模型类的对象，等同于django的models.py
	middlewares.py # 中间件：爬虫中间件，下载中间件都写在这里面
	pipelines.py #项目管道---》以后写持久化，都在这里面写
	run.py # 自己写的，运行爬虫
	settings.py # 配置文件 django的配置文件
	scrapy.cfg # 项目上线用的，不需要关注

	1 response对象有css方法和xpath方法
	-css中写css选择器
	-xpath中写xpath选择
	2 重点1：
	-xpath取文本内容
	'.//a[contains(@class,"link-title")]/text()'
	-xpath取属性
	'.//a[contains(@class,"link-title")]/@href'
	-css取文本
	'a.link-title::text'
	-css取属性
	'img.image-scale::attr(src)'
	3 重点2：
	.extract_first() 取一个
	.extract() 取所有

	# def parse(self, response):
	# # 解析数据 css解析
	# article_list = response.css('article.post-item')
	# for article in article_list:
	# title = article.css('div.post-item-text>a::text').extract_first()
	# author_img = article.css('div.post-item-text img::attr(src)').extract_first()
	# author_name = article.css('footer span::text').extract_first()
	# desc_old = article.css('p.post-item-summary::text').extract()
	# desc = desc_old[0].replace('\n', '').replace(' ', '')
	# if not desc:
	# desc = desc_old[1].replace('\n', '').replace(' ', '')
	# url=article.css('div.post-item-text>a::attr(href)').extract_first()
	# # 文章真正的内容，没拿到，它不在这个页面中，它在下一个页面中
	# print(title)
	# print(author_img)
	# print(author_name)
	# print(desc)
	# print(url)

	def parse(self, response):
	# 解析数据 css解析
	article_list = response.xpath('//*[@id="post_list"]/article')
	# article_list = response.xpath('//article[contains(@class,"post-item")]')
	for article in article_list:
	title = article.xpath('.//div/a/text()').extract_first()
	author_img = article.xpath('.//div//img/@src').extract_first()
	author_name = article.xpath('.//footer//span/text()').extract_first()
	desc_old = article.xpath('.//p/text()').extract()
	desc = desc_old[0].replace('\n', '').replace(' ', '')
	if not desc:
	desc = desc_old[1].replace('\n', '').replace(' ', '')
	url = article.xpath('.//div/a/@href').extract_first()
	# 文章真正的内容，没拿到，它不在这个页面中，它在下一个页面中
	print(title)
	print(author_img)
	print(author_name)
	print(desc)
	print(url)

	# scrapy 项目有项目自己的配置文件，还有内置的

	#1 了解
	BOT_NAME = "firstscrapy" #项目名字，整个爬虫名字
	#2 爬虫存放位置了解
	SPIDER_MODULES = ["firstscrapy.spiders"]
	NEWSPIDER_MODULE = "firstscrapy.spiders"

	#3 记住是否遵循爬虫协议，一般都设为False
	ROBOTSTXT_OBEY = False
	# 4 记住
	USER_AGENT = "firstscrapy (+http://www.yourdomain.com)"
	#5 记住日志级别
	LOG_LEVEL='ERROR'

	#6 记住 DEFAULT_REQUEST_HEADERS 默认请求头
	DEFAULT_REQUEST_HEADERS = {
	'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,/;q=0.8',
	'Accept-Language': 'en',
	}

	#7 记住后面学 SPIDER_MIDDLEWARES 爬虫中间件
	SPIDER_MIDDLEWARES = {
	'cnblogs.middlewares.CnblogsSpiderMiddleware': 543,
	}
	#8 后面学 DOWNLOADER_MIDDLEWARES 下载中间件
	DOWNLOADER_MIDDLEWARES = {
	'cnblogs.middlewares.CnblogsDownloaderMiddleware': 543,
	}

	#9 后面学 ITEM_PIPELINES 持久化配置
	ITEM_PIPELINES = {
	'cnblogs.pipelines.CnblogsPipeline': 300,
	}

	#1 增加并发：默认16
	默认scrapy开启的并发线程为32个，可以适当进行增加。在settings配置文件中修改
	CONCURRENT_REQUESTS = 100
	值为100,并发设置成了为100。
	#2 降低日志级别：
	在运行scrapy时，会有大量日志信息的输出，为了减少CPU的使用率。可以设置log输出信息为INFO或者ERROR即可。在配置文件中编写：
	LOG_LEVEL = 'INFO'
	# 3 禁止cookie：
	如果不是真的需要cookie，则在scrapy爬取数据时可以禁止cookie从而减少CPU的使用率，提升爬取效率。在配置文件中编写：
	COOKIES_ENABLED = False
	# 4 禁止重试：
	对失败的HTTP进行重新请求（重试）会减慢爬取速度，因此可以禁止重试。在配置文件中编写：
	RETRY_ENABLED = False
	# 5 减少下载超时：
	如果对一个非常慢的链接进行爬取，减少下载超时可以能让卡住的链接快速被放弃，从而提升效率。在配置文件中进行编写：
	DOWNLOAD_TIMEOUT = 10 超时时间为10s

	# 方式一：（parse必须有return值，必须是列表套字典形式--->使用命令，可以保存到json格式中，csv中。。。）
	scrapy crawl cnblogs -o cnbogs.json

	# 方式二：我们用的，使用pipline存储---》可以存到多个位置
	-第一步：在item.py中写一个类
	class FirstscrapyItem(scrapy.Item):
	title = scrapy.Field()
	author_img = scrapy.Field()
	author_name = scrapy.Field()
	desc = scrapy.Field()
	url = scrapy.Field()
	# 博客文章内容，但是暂时没有
	content = scrapy.Field()

	-第二步：在pipline.py中写代码，写一个类：open_spide,close_spider，process_item
	-open_spide：开启爬虫会触发
	-close_spider：爬完会触发
	-process_ite:每次要保存一个对象会触发
	class FirstscrapyFilePipeline:
	def open_spider(self, spider):
	print('我开了')
	self.f=open('a.txt','w',encoding='utf-8')
	def close_spider(self, spider):
	print('我关了')
	self.f.close()
	# 这个很重要
	def process_item(self, item, spider):
	self.f.write(item['title']+'\n')
	return item
	-第三步：配置文件配置
	ITEM_PIPELINES = {
	"firstscrapy.pipelines.FirstscrapyFilePipeline": 300, # 数字越小，优先级越高
	}

	-第四步：在解析方法parse中yield item对象

	# Request创建：在parse中，for循环中，创建Request对象时，传入meta
	yield Request(url=url, callback=self.detail_parse,meta={'item':item})

	# Response对象：detail_parse中，通过response取出meta取出item，把文章详情写入
	yield item

	import scrapy
	from bs4 import BeautifulSoup
	from firstscrapy.items import FirstscrapyItem
	from scrapy.http.request import Request

	class CnblogsSpider(scrapy.Spider):
	name = "cnblogs"
	allowed_domains = ["www.cnblogs.com"]
	start_urls = ["http://www.cnblogs.com/"]

	# 解析出下一页地址，继续爬取
	def parse(self, response):
	article_list = response.xpath('//*[@id="post_list"]/article')
	# article_list = response.xpath('//article[contains(@class,"post-item")]')
	# l=[]
	for article in article_list:
	item = FirstscrapyItem()
	title = article.xpath('.//div/a/text()').extract_first()
	item['title'] = title
	author_img = article.xpath('.//div//img/@src').extract_first()
	item['author_img'] = author_img
	author_name = article.xpath('.//footer//span/text()').extract_first()
	item['author_name'] = author_name
	desc_old = article.xpath('.//p/text()').extract()
	desc = desc_old[0].replace('\n', '').replace(' ', '')
	if not desc:
	desc = desc_old[1].replace('\n', '').replace(' ', '')
	item['desc'] = desc
	url = article.xpath('.//div/a/@href').extract_first()
	item['url'] = url
	# print(title)
	# yield item对象不完整，缺文章的content，而文章的content在下一个页面中,而此处要yield一个Request对象
	# yield item
	yield Request(url=url,callback=self.parser_detail,meta={'item':item}) # 爬完后执行的解析方法


	next='https://www.cnblogs.com'+response.css('div.pager>a:last-child::attr(href)').extract_first()
	print(next) # 继续爬取
	yield Request(url=next,callback=self.parse)



	# 解析详情的方法
	def parser_detail(self,response):
	# print(response.status)
	# 解析出文章内容
	content=response.css('#cnblogs_post_body').extract_first()
	# print(str(content))
	# 如何放到item中
	item=response.meta.get('item')
	if content:
	item['content']=content
	else:
	item['content'] = '没查到'
	yield item

	#1 面试官要看你项目
	- 编码水平
	- 公司的看不了，给他看的，全是个人项目
	- 公司项目看不了，签了保密协议


	#2 数据库如何处理的？
	-云数据库：阿里云数据库，花钱，买服务---》账号和密码---》公司不需要自己搭建mysql
	-mysql
	-redis
	-mongodb
	-自己的数据库，部署在云服务器上的数据库，是你自己的


	# 3 你用过什么云产品？
	- 阿里云的ecs，服务器
	- 阿里云的oss ，对象存储
	- 云短信
	- 七牛云文件存储


	# 4 看看你的数据库
	-配置文件 dev.py 连的是本地127.0.0.1
	-你们上线怎么弄
	-我不知道，就是给我一个地址，端口，用户名密码

	- 上线的数据库服务和项目服务是在同一台及其上吗？

	# 5 celery用过
	定时任务
	定时
	异步任务



	# 6 多线程用过
	-用过
	-怎么用的？两种方式
	-类实例化得到对象Thread类传入target 任务函数，对象.start
	-写一个类，继承Thread，重写run方法，写任务类实例化得到对象对象.start
	-如果io密集型，用多线程，计算密集型用多进程 ---》只针对于cpython


	# 7 mysql 用过，索引你知道吗？
	唯一索引和联合索引有什么区别


	#8 1千万w，性别字段(男女)，查询时候，这个字段要不要加索引
	-因为它就两种状态，建立索引是没用的，即便建立索引，也不会走




	# 9 实现踢下线
	-session机制---》表中把它那条记录删除
	-token机制----》
	-下线人id----》放个位置
	-进入到认证类中---》

	# 10 实现黑名单功能
	-建立个黑名单表
	-id 用户id ，ip，时间。。。