爬虫学习笔记
前言
爬虫可以采集数据……
"'网络爬虫(又被称为网页蜘蛛,网络机器人)就是模拟客户端发送网络请求,获取响应数据,一种按照一定的规则,自动地抓取万维网信息的程序或脚本''
1 基础知识
网页HTML、CSS、JavaScripts
Robots协议基础
- User-agent:
- Disallow:
2 网页请求
Python HTTP请求库
# pip install requests
# 1、导入模块
import requests
# 2、发送get请求, 获取响应
response = requests.get('https://www.baidu.com/')
#3、从响应中获取数据
print(response.text)
requsts.requst() - > 构造一个请求,最基本的方法,是下面方法的支撑
requsts.get() - >获取网页,对应HTTP中的GET方法
requsts.post() - > 向网页提交信息,对应HTTP中的POST方法
requsts.head() - > 获取html网页的头信息,对应HTTP中的HEAD方法
requsts.put() - > 向html提交put方法,对应HTTP中的PUT方法
requsts.patch() - > 向html网页提交局部请求修改的的请求,对应HTTP中的PATCH方法
requsts.delete() - > 向html提交删除请求,对应HTTP中的DELETE方法
学习资源
https://www.heywhale.com/home/activity/detail/622706b9fd71770017f32077/content/1