爬虫学习笔记

前言

爬虫可以采集数据……

"'网络爬虫(又被称为网页蜘蛛,网络机器人)就是模拟客户端发送网络请求,获取响应数据,一种按照一定的规则,自动地抓取万维网信息的程序或脚本''

1 基础知识

网页HTML、CSS、JavaScripts
Robots协议基础

  • User-agent:
  • Disallow:

2 网页请求

Python HTTP请求库

# pip install requests

# 1、导入模块
import requests

# 2、发送get请求, 获取响应
response = requests.get('https://www.baidu.com/')

#3、从响应中获取数据
print(response.text)

requsts.requst() - > 构造一个请求,最基本的方法,是下面方法的支撑
requsts.get() - >获取网页,对应HTTP中的GET方法
requsts.post() - > 向网页提交信息,对应HTTP中的POST方法
requsts.head() - > 获取html网页的头信息,对应HTTP中的HEAD方法
requsts.put() - > 向html提交put方法,对应HTTP中的PUT方法
requsts.patch() - > 向html网页提交局部请求修改的的请求,对应HTTP中的PATCH方法
requsts.delete() - > 向html提交删除请求,对应HTTP中的DELETE方法

学习资源

https://www.heywhale.com/home/activity/detail/622706b9fd71770017f32077/content/1

posted @ 2024-08-16 20:27  zgwen  阅读(0)  评论(0编辑  收藏  举报