吃西瓜--爬虫系列之Request使用方法

get请求写成post、post请求写成get，需要确定请求方式；判断User-Agent是否是浏览器，程序默认Python，爬虫程序需要定制伪装；Referer机制，表明这个请求是从哪个url过来的，如果是直接请求过来了的则认为是爬虫，所以Referer一般指定为上一个页面的url，进行伪装。Cookie，如果是需要登录的网址，则需要发送Cookie，否则拒绝服务！一般常见的反爬虫机制就这些，后面遇见再补充。

常见响应状态码：

200：请求正常，但是如果被服务器发现是爬虫，有些恶心的机制会返回假数据给你，所以状态码为200也不一定对；400：url找不到，即url错误；403：拒绝服务，即权限不够；500：服务器内部错误；301：永久重定向；302：临时重定向，例如需要登录时则回到登录页面。其他遇见了自己百度即可！

下面介绍两个库，想速成直接跳到Requests库！不用看前面的！

urllib库

urllib库是Python中一个最基本的网络请求库。可以模拟浏览器的行为，向指定的服务器发送一个请求，并可以保存服务器返回的数据。

urlopen函数：

在Python3的urllib库中，所有和网络请求相关的方法，都被集到urllib.request模块下面了，以先来看下urlopen函数基本的使用：

from urllib import request
res=request.urlopen("http://www.baidu.com")
print(res.read())
print(res.getcode()) //返回状态码

以下对urlopen函数的进行详细讲解：

url：请求的url。
data：请求的data，如果设置了这个值，那么将变成post请求，否则默认get请求。
返回值：返回值是一个http.client.HTTPResponse对象，这个对象是一个类文件句柄对象。有read(size)、readline、readlines以及getcode等方法。

urlretrieve函数：

这个函数可以方便的将网页上的一个文件（图片、网页、视频、音频等等）保存到本地。

以下代码可以非常方便的将百度的首页下载到本地：

from urllib import request
request.urlretrieve('http://www.baidu.com/','baidu.html')

urlencode函数：

用浏览器发送请求的时候，如果url中包含了中文或者其他特殊字符，那么浏览器会自动的给我们进行编码。而如果使用代码发送请求，那么就必须手动的进行编码，这时候就应该使用urlencode函数来实现。urlencode可以把字典数据转换为URL编码的数据。示例代码如下：

from urllib import parse
data = {'name':'陈奕迅','greet':'hello world','age':100}
qs = parse.urlencode(data)
print(qs)

parse_qs函数：

可以将经过编码后的url参数进行解码。示例代码如下：

from urllib import parse
qs = "name=%E7%88%AC%E8%99%AB%E5%9F%BA%E7%A1%80&greet=hello+world&age=100"
print(parse.parse_qs(qs))

url="http://www.baidu.com/s"
params={'wd':"陈奕迅"}
qs=parse.urlencode(params)
url=url+'?'+qs
res=request.urlopen(url)
print(res.read())

urlparse和urlsplit：

有时候拿到一个url，想要对这个url中的各个组成部分进行分割，那么这时候就可以使用urlparse或者是urlsplit来进行分割，urlparse和urlsplit基本上是一模一样的。示例代码如下：

from urllib import request,parse

url = 'http://www.baidu.com/s?zhiliao'

result = parse.urlsplit(url)
# result = parse.urlparse(url)

print('scheme:',result.scheme)
print('netloc:',result.netloc)
print('path:',result.path)
print('query:',result.query)

request.Request类：

如果想要在请求的时候增加一些请求头，那么就必须使用request.Request类来实现。比如要增加一个User-Agent，示例代码如下：

from urllib import request

headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36'
}
req = request.Request("http://www.baidu.com/",headers=headers)
resp = request.urlopen(req)
print(resp.read())

阶段性实训：爬取具有反爬机制的职位信息网站：

特别注意：这个网站必须要有User-Agent、Cookie、Referer三者缺一不可，否则会出现虚假提示“操作频繁”！

from urllib import parse
from urllib import request


url='https://www.lagou.com/jobs/positionAjax.json?jd=%E6%9C%AA%E8%9E%8D%E8%B5%84&px=default&city=%E4%B8%8A%E6%B5%B7&needAddtionalResult=false'
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/89.0.4389.114 Safari/537.36',
    'referer': 'https://www.lagou.com/jobs/list_PHP/p-city_3-jd_1?px=default',
     'cookie':'user_trace_token=20210406172445-1d25ab74-c910-4783-9b84-c928fc99bf4a; _ga=GA1.2.591359575.1617700950; LGUID=20210406172446-8ec58e7a-4dff-4697-b536-871deb0bf297; SL_GWPT_Show_Hide_tmp=1; SL_wptGlobTipTmp=1; JSESSIONID=ABAAABAABEIABCID008C43966AF564341B1AF34B99A82F1; WEBTJ-ID=2021046%E4%B8%8B%E5%8D%885:22:47172247-178a67dd5ae3e6-0c8a4c973f49b7-c3f3568-1327104-178a67dd5af888; RECOMMEND_TIP=true; Hm_lvt_4233e74dff0ae5bd0a3d81c6ccf756e6=1617700950,1617700968; sajssdk_2015_cross_new_user=1; sensorsdata2015session=%7B%7D; _gid=GA1.2.390514112.1617700968; TG-TRACK-CODE=index_navigation; __lg_stoken__=196f3d3fd4ec6e4898a033a32cbdd87d119b155da22cd119dfcd31e3ce99a49d5ee2e6dd9b5ff60f09e4e5d93c5d2be3f4097f33dd63e66da6eb65227fac58dcba8fff84ad77; PRE_UTM=; PRE_HOST=; PRE_LAND=https%3A%2F%2Fwww.lagou.com%2Fjobs%2Flist%5FPython%2Fp-city%5F3%3Fpx%3Ddefault%23filterBox; PRE_SITE=; LGSID=20210406193127-8e623399-a6ce-427b-820f-0ab1836625e4; index_location_city=%E6%9D%AD%E5%B7%9E; X_HTTP_TOKEN=472b1de01181b8697019077161c96a0362eecefe96; sensorsdata2015jssdkcross=%7B%22distinct_id%22%3A%22178a67dd761516-022460db3e080a-c3f3568-1327104-178a67dd7624da%22%2C%22first_id%22%3A%22%22%2C%22props%22%3A%7B%22%24latest_traffic_source_type%22%3A%22%E7%9B%B4%E6%8E%A5%E6%B5%81%E9%87%8F%22%2C%22%24latest_search_keyword%22%3A%22%E6%9C%AA%E5%8F%96%E5%88%B0%E5%80%BC_%E7%9B%B4%E6%8E%A5%E6%89%93%E5%BC%80%22%2C%22%24latest_referrer%22%3A%22%22%2C%22%24os%22%3A%22Windows%22%2C%22%24browser%22%3A%22Chrome%22%2C%22%24browser_version%22%3A%2289.0.4389.114%22%7D%2C%22%24device_id%22%3A%22178a67dd761516-022460db3e080a-c3f3568-1327104-178a67dd7624da%22%7D; Hm_lpvt_4233e74dff0ae5bd0a3d81c6ccf756e6=1617708972; LGRID=20210406193827-4f487d75-b774-429c-8d05-10dbfd107e71; SEARCH_ID=ec90d17554414f888cf7d5483f660646'
}
data={
    'first': 'true',
    'pn':1,
    'kd':'PHP'
}
req=request.Request(url,headers=headers,data=parse.urlencode(data).encode('utf-8'),method='POST')
result=request.urlopen(req)
print(result.read().decode('utf-8'))

下面这段获取页面的爬虫不知道为何被识别出来了，后面知道了再来看：

from urllib import parse
from urllib import request
url='https://www.lagou.com/jobs/list_php%E5%90%8E%E7%AB%AF?oquery=PHP&fromSearch=true&labelWords=relative&city=%E4%B8%8A%E6%B5%B7'
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/89.0.4389.114 Safari/537.36',
     'referer': 'https://www.lagou.com/jobs/list_PHP/p-city_3-jd_1?px=default',
    'cookie':'user_trace_token=20210406172445-1d25ab74-c910-4783-9b84-c928fc99bf4a; _ga=GA1.2.591359575.1617700950; LGUID=20210406172446-8ec58e7a-4dff-4697-b536-871deb0bf297; SL_wptGlobTipTmp=1; SL_GWPT_Show_Hide_tmp=1; JSESSIONID=ABAAABAABEIABCID008C43966AF564341B1AF34B99A82F1; WEBTJ-ID=2021046%E4%B8%8B%E5%8D%885:22:47172247-178a67dd5ae3e6-0c8a4c973f49b7-c3f3568-1327104-178a67dd5af888; RECOMMEND_TIP=true; Hm_lvt_4233e74dff0ae5bd0a3d81c6ccf756e6=1617700950,1617700968; sajssdk_2015_cross_new_user=1; sensorsdata2015session=%7B%7D; _gid=GA1.2.390514112.1617700968; __lg_stoken__=196f3d3fd4ec6e4898a033a32cbdd87d119b155da22cd119dfcd31e3ce99a49d5ee2e6dd9b5ff60f09e4e5d93c5d2be3f4097f33dd63e66da6eb65227fac58dcba8fff84ad77; index_location_city=%E6%9D%AD%E5%B7%9E; TG-TRACK-CODE=search_code; LGSID=20210406203850-9ca9bf81-661c-4697-a6bf-a9924a5dcc50; PRE_UTM=; PRE_HOST=; PRE_SITE=https%3A%2F%2Fwww.lagou.com%2Fjobs%2Flist%5FPHP%2Fp-city%5F3%3Fpx%3Ddefault; PRE_LAND=https%3A%2F%2Fwww.lagou.com%2Fjobs%2Flist%5FPHP%2Fp-city%5F3-jd%5F1%3Fpx%3Ddefault%23filterBox; X_MIDDLE_TOKEN=9e3be039cb63614037dbc5868765704c; _gat=1; SEARCH_ID=e5b81ab0943343e9b7341b7fd3cbc424; X_HTTP_TOKEN=472b1de01181b8695334177161c96a0362eecefe96; sensorsdata2015jssdkcross=%7B%22distinct_id%22%3A%22178a67dd761516-022460db3e080a-c3f3568-1327104-178a67dd7624da%22%2C%22first_id%22%3A%22%22%2C%22props%22%3A%7B%22%24latest_traffic_source_type%22%3A%22%E7%9B%B4%E6%8E%A5%E6%B5%81%E9%87%8F%22%2C%22%24latest_search_keyword%22%3A%22%E6%9C%AA%E5%8F%96%E5%88%B0%E5%80%BC_%E7%9B%B4%E6%8E%A5%E6%89%93%E5%BC%80%22%2C%22%24latest_referrer%22%3A%22%22%2C%22%24os%22%3A%22Windows%22%2C%22%24browser%22%3A%22Chrome%22%2C%22%24browser_version%22%3A%2289.0.4389.114%22%7D%2C%22%24device_id%22%3A%22178a67dd761516-022460db3e080a-c3f3568-1327104-178a67dd7624da%22%7D; Hm_lpvt_4233e74dff0ae5bd0a3d81c6ccf756e6=1617714200; LGRID=20210406210535-b85d51bf-1f5a-46b4-a58a-e0ca9543f6a1'
    }
req=request.Request(url,headers=headers)
result=request.urlopen(req)
print(result.read().decode('utf-8'))

ProxyHandler处理器（代理设置）

很多网站会检测某一段时间某个IP的访问次数(通过流量统计，系统日志等)，如果访问次数多的不像正常人，它会禁止这个IP的访问。
所以我们可以设置一些代理服务器，每隔一段时间换一个代理，就算IP被禁止，依然可以换个IP继续爬取。
urllib中通过ProxyHandler来设置使用代理服务器，下面代码说明如何使用自定义opener来使用代理

from urllib import request

# 这个是没有使用代理的
# resp = request.urlopen('http://httpbin.org/get')
# print(resp.read().decode("utf-8"))

# 这个是使用了代理的
handler = request.ProxyHandler({"http":"218.66.161.88:31769"})

opener = request.build_opener(handler)
req = request.Request("http://httpbin.org/ip")
resp = opener.open(req)
print(resp.read())

常用的代理有：

from urllib import parse
from urllib import request

url='https://2021.ip138.com/'
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/89.0.4389.114 Safari/537.36',
     'referer': 'https://www.ip138.com/',
    'cookie':'Hm_lvt_ecdd6f3afaa488ece3938bcdbb89e8da=1610613275'
   }
#创建代理
handler=request.ProxyHandler({'http':'115.29.230.38:80'})
opener=request.build_opener(handler)
# req=request.Request(url,headers=headers)
#resp=opener.open(req)
resp=opener.open(url)
print(resp.read().decode('utf-8'))

# req=request.Request(url,headers=headers)
# result=request.urlopen(req)
# print(result.read().decode('utf-8'))

爬取需要登录的网站

使用到cookie：

在网站中，http请求是无状态的。也就是说即使第一次和服务器连接后并且登录成功后，第二次请求服务器依然不能知道当前请求是哪个用户。cookie的出现就是为了解决这个问题，第一次登录后服务器返回一些数据（cookie）给浏览器，然后浏览器保存在本地，当该用户发送第二次请求的时候，就会自动的把上次请求存储的cookie数据自动的携带给服务器，服务器通过浏览器携带的数据就能判断当前用户是哪个了。cookie存储的数据量有限，不同的浏览器有不同的存储大小，但一般不超过4KB。因此使用cookie只能存储一些小量的数据。

cookie的格式：

Set-Cookie: NAME=VALUE；Expires/Max-age=DATE；Path=PATH；Domain=DOMAIN_NAME；SECURE

参数意义：

NAME：cookie的名字。
VALUE：cookie的值。
Expires：cookie的过期时间。
Path：cookie作用的路径。
Domain：cookie作用的域名。
SECURE：是否只在https协议下起作用。

使用cookielib库和HTTPCookieProcessor模拟登录：

Cookie 是指网站服务器为了辨别用户身份和进行Session跟踪，而储存在用户浏览器上的文本文件，Cookie可以保持登录信息到用户下次与服务器的会话。
这里以人人网为例。人人网中，要访问某个人的主页，必须先登录才能访问，登录说白了就是要有cookie信息。那么如果我们想要用代码的方式访问，就必须要有正确的cookie信息才能访问。解决方案有两种，第一种是使用浏览器访问，然后将cookie信息复制下来，放到headers中。示例代码如下：

下面是使用Cookie爬取智联招聘个人简历，首先登录自己的简历界面再找Cookie，如果不使用cookie的话则返回一个登录页面！

from urllib import request
from urllib import parse

url='https://i.zhaopin.com/resume'
headers={
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/89.0.4389.114 Safari/537.36'
    ,'Referer': 'https://www.zhaopin.com/',
    'Cookie':'adfbid2=0; x-zp-client-id=2f4bfe08-df19-497e-8593-c152bd3f68ee; sts_deviceid=177c263d08d908-05a862904cc5cd-73e356b-1327104-177c263d08e6c4; _uab_collina=161387408561030908389537; ssxmod_itna2=iqmx0D9Qiti=T4BcDeTm+AGODBDUEhG+qOhd4xA6nh3D/BfDFrkGTUpRPApKOqOCBEr9t4RAiGyrGWlQjBr4zbx7QqUDjKD2QYD=; urlfrom2=121113803; sensorsdata2015jssdkcross=%7B%22distinct_id%22%3A%221049870415%22%2C%22first_id%22%3A%22177b9dd977f6f-020a8969613f07-53e3566-1327104-177b9dd9780b3b%22%2C%22props%22%3A%7B%22%24latest_traffic_source_type%22%3A%22%E4%BB%98%E8%B4%B9%E5%B9%BF%E5%91%8A%E6%B5%81%E9%87%8F%22%2C%22%24latest_search_keyword%22%3A%22%E6%99%BA%E8%81%94%E6%8B%9B%E8%81%98%22%2C%22%24latest_referrer%22%3A%22https%3A%2F%2Fwww.baidu.com%2Fother.php%22%2C%22%24latest_utm_source%22%3A%22baidupcpz%22%2C%22%24latest_utm_medium%22%3A%22cpt%22%2C%22%24latest_utm_campaign%22%3A%22jl%22%2C%22%24latest_utm_content%22%3A%22tj%22%2C%22%24latest_utm_term%22%3A%2228757838%22%7D%2C%22%24device_id%22%3A%22177b9dd977f6f-020a8969613f07-53e3566-1327104-177b9dd9780b3b%22%7D; urlfrom=121113803; adfbid=0; sts_sg=1; sts_sid=178aaa2a42e6e6-07fc249754b7b5-c3f3568-1327104-178aaa2a42f537; sts_chnlsid=121113803; zp_src_url=https%3A%2F%2Fwww.baidu.com%2Fother.php%3Fsc.K60000K_AV0UxOsHA1WeDFNeMVr-UPsiBJtLez6Uq9_55OWQGkRJ0F1QOkT_glOmywiCeCCv6iCFeEWfZsrVyhIgnQ070ALwkiwPMlvtWM2fvBvMQ-Z9iVPKpntzTR8Jp2CPVJUhXGrvtprUTDxl4iUX2nPr-tNIiYxvgBYiNl8NDb_igy9xD7ovu1GscKVaUkYuJU9aCXpngPEXRZxDUGpQO1Vg.7Y_NR2Ar5Od669BCXgjRzeASFDZtwhUVHf632MRRt_Q_DNKnLeMX5Dkgbooo3eQr5gKPwmJCRnTxOoKKsTZK4TPHQ_U3bIt7jHzk8sHfGmEukmnTr59l32AM-YG8x6Y_f3lZgKfYt_QCJamJjArZZsqT7jHzs_lTUQqRHArZ5Xq-dKl-muCyrMWYv0.TLFWgv-b5HDkrfK1ThPGujYknHb0THY0IAYqd_xKJVgfko60IgP-T-qYXgK-5H00mywxIZ-suHY10ZIEThfqd_xKJVgfko60ThPv5HD0IgF_gv-b5HDdnWf4Pj6Ln1n0UgNxpyfqnHfzPHfYnWf0UNqGujYknjbsnjnLnsKVIZK_gv-b5HDznWT10ZKvgv-b5H00pywW5R9rf6KWThnqn10snWf%26ck%3D5127.1.105.460.154.445.166.270%26dt%3D1617770621%26wd%3D%25E6%2599%25BA%25E8%2581%2594%25E6%258B%259B%25E8%2581%2598%26tpl%3Dtpl_12273_24677_20875%26l%3D1524948733%26us%3DlinkName%253D%2525E6%2525A0%252587%2525E9%2525A2%252598-%2525E4%2525B8%2525BB%2525E6%2525A0%252587%2525E9%2525A2%252598%2526linkText%253D%2525E3%252580%252590%2525E6%252599%2525BA%2525E8%252581%252594%2525E6%25258B%25259B%2525E8%252581%252598%2525E3%252580%252591%2525E5%2525AE%252598%2525E6%252596%2525B9%2525E7%2525BD%252591%2525E7%2525AB%252599%252520%2525E2%252580%252593%252520%2525E5%2525A5%2525BD%2525E5%2525B7%2525A5%2525E4%2525BD%25259C%2525EF%2525BC%25258C%2525E4%2525B8%25258A%2525E6%252599%2525BA%2525E8%252581%252594%2525E6%25258B%25259B%2525E8%252581%252598%2525EF%2525BC%252581%2526linkType%253D; acw_tc=2760829b16177706809588871e6e5f19aefce52760874a088a02a911916ac0; ZP-ENV-FLAG=gray; ZP_OLD_FLAG=false; Hm_lvt_38ba284938d5eddca645bb5e02a02006=1617770545; SL_GWPT_Show_Hide_tmp=1; SL_wptGlobTipTmp=1; LastCity=%E6%9D%AD%E5%B7%9E; LastCity%5Fid=653; at=4e39069e2fd04bd1886d920b2eb88eed; rt=87d20a4d89ef410da5028fc43eeeb67e; ZPCITIESCLICKED=|653; ssxmod_itna=YqRx2DB7eQqrD7DzxA2Y=DkQGklKKK33G8Y00DBuGW4iNDnD8x7YDvmmEiIKGKYxxxvWxOGhewQEimhRfmdgmhr3YFrxB3DEx0=KqmGi4GGjxBYDQxAYDGDDPDocPD1D3qDkXxYPGW8qDbDiWkvxGCDeKD0xuFDQKDucKainIGkOA1tb5q48Gx6xG1i40Hmi8p3FSEinH3vx0k040OBOHkugYDUY2DNgLeZQFaqn2NeGDNqsiKiB0xWYhbK7x4/Ax3TCxe4D; ZL_REPORT_GLOBAL={%22//www%22:{%22seid%22:%224e39069e2fd04bd1886d920b2eb88eed%22%2C%22actionid%22:%225251163e-5979-4574-9670-222ac9a8a386-cityPage%22%2C%22funczone%22:%22city_hotjd%22}%2C%22jobs%22:{%22funczoneShare%22:%22dtl_best_for_you%22%2C%22recommandActionidShare%22:%221cae3ff7-762e-4708-b814-fc2d18caa64b-job%22}}; sts_evtseq=14; Hm_lpvt_38ba284938d5eddca645bb5e02a02006=1617771364'
}

req=request.Request(headers=headers,url=url)
rsp=request.urlopen(req)
print(rsp.read().decode('utf-8'))

with open('index.html','w',encoding='utf-8') as fp:
    fp.write(rsp.read().decode('utf-8'))

但是每次在访问需要cookie的页面都要从浏览器中复制cookie比较麻烦。在Python处理Cookie，一般是通过http.cookiejar模块和urllib模块的HTTPCookieProcessor处理器类一起使用。http.cookiejar模块主要作用是提供用于存储cookie的对象。而HTTPCookieProcessor处理器主要作用是处理这些cookie对象，并构建handler对象。

http.cookiejar模块：

该模块主要的类有CookieJar、FileCookieJar、MozillaCookieJar、LWPCookieJar。这四个类的作用分别如下：

CookieJar：管理HTTP cookie值、存储HTTP请求生成的cookie、向传出的HTTP请求添加cookie的对象。整个cookie都存储在内存中，对CookieJar实例进行垃圾回收后cookie也将丢失。
FileCookieJar (filename,delayload=None,policy=None)：从CookieJar派生而来，用来创建FileCookieJar实例，检索cookie信息并将cookie存储到文件中。filename是存储cookie的文件名。delayload为True时支持延迟访问访问文件，即只有在需要时才读取文件或在文件中存储数据。
MozillaCookieJar (filename,delayload=None,policy=None)：从FileCookieJar派生而来，创建与Mozilla浏览器 cookies.txt兼容的FileCookieJar实例。
LWPCookieJar (filename,delayload=None,policy=None)：从FileCookieJar派生而来，创建与libwww-perl标准的 Set-Cookie3 文件格式兼容的FileCookieJar实例。

登录人人网：

利用http.cookiejar和request.HTTPCookieProcessor登录人人网。相关示例代码如下：

from urllib import request,parse
from http.cookiejar import CookieJar

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36'
}

def get_opener():
    cookiejar = CookieJar()
    handler = request.HTTPCookieProcessor(cookiejar)
    opener = request.build_opener(handler)
    return opener

def login_renren(opener):
    data = {"email": "970138074@qq.com", "password": "pythonspider"}
    data = parse.urlencode(data).encode('utf-8')
    login_url = "http://www.renren.com/PLogin.do"
    req = request.Request(login_url, headers=headers, data=data)
    opener.open(req)

def visit_profile(opener):
    url = 'http://www.renren.com/880151247/profile'
    req = request.Request(url,headers=headers)
    resp = opener.open(req)
    with open('renren.html','w') as fp:
        fp.write(resp.read().decode("utf-8"))

if __name__ == '__main__':
    opener = get_opener()
    login_renren(opener)
    visit_profile(opener)

登录智联招聘发现其反扒机制很恶心，登录居然用的是GET方法！然后，登录除了账号密码之外还有其他的data！

from urllib import request
from urllib import parse
from http.cookiejar import CookieJar
# 1、登录
# 1.1、创建一个cookiejar对象
cookiejar=CookieJar()
# 1.2、使用cookiejar创建一个HTTPCookieProcess对象
handle=request.HTTPCookieProcessor(cookiejar)
# 1.3、使用上一步创建的handler创建一个opener
opener=request.build_opener(handle)
# 1.4、使用opener发送登录请求
headers={
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/89.0.4389.114 Safari/537.36'
    ,'Referer':'https://passport.zhaopin.com/login?bkUrl=%2F%2Fi.zhaopin.com%2Fblank%3Fhttps%3A%2F%2Fwww.zhaopin.com%2F'
    #,'Cookie':'adfbid2=0; x-zp-client-id=2f4bfe08-df19-497e-8593-c152bd3f68ee; sts_deviceid=177c263d08d908-05a862904cc5cd-73e356b-1327104-177c263d08e6c4; ssxmod_itna2=iqmx0D9Qiti=T4BcDeTm+AGODBDUEhG+qOhd4xA6nh3D/BfDFrkGTUpRPApKOqOCBEr9t4RAiGyrGWlQjBr4zbx7QqUDjKD2QYD=; urlfrom2=121113803; urlfrom=121113803; adfbid=0; sts_sg=1; sts_chnlsid=121113803; zp_src_url=https%3A%2F%2Fwww.baidu.com%2Fother.php%3Fsc.K60000K_AV0UxOsHA1WeDFNeMVr-UPsiBJtLez6Uq9_55OWQGkRJ0F1QOkT_glOmywiCeCCv6iCFeEWfZsrVyhIgnQ070ALwkiwPMlvtWM2fvBvMQ-Z9iVPKpntzTR8Jp2CPVJUhXGrvtprUTDxl4iUX2nPr-tNIiYxvgBYiNl8NDb_igy9xD7ovu1GscKVaUkYuJU9aCXpngPEXRZxDUGpQO1Vg.7Y_NR2Ar5Od669BCXgjRzeASFDZtwhUVHf632MRRt_Q_DNKnLeMX5Dkgbooo3eQr5gKPwmJCRnTxOoKKsTZK4TPHQ_U3bIt7jHzk8sHfGmEukmnTr59l32AM-YG8x6Y_f3lZgKfYt_QCJamJjArZZsqT7jHzs_lTUQqRHArZ5Xq-dKl-muCyrMWYv0.TLFWgv-b5HDkrfK1ThPGujYknHb0THY0IAYqd_xKJVgfko60IgP-T-qYXgK-5H00mywxIZ-suHY10ZIEThfqd_xKJVgfko60ThPv5HD0IgF_gv-b5HDdnWf4Pj6Ln1n0UgNxpyfqnHfzPHfYnWf0UNqGujYknjbsnjnLnsKVIZK_gv-b5HDznWT10ZKvgv-b5H00pywW5R9rf6KWThnqn10snWf%26ck%3D5127.1.105.460.154.445.166.270%26dt%3D1617770621%26wd%3D%25E6%2599%25BA%25E8%2581%2594%25E6%258B%259B%25E8%2581%2598%26tpl%3Dtpl_12273_24677_20875%26l%3D1524948733%26us%3DlinkName%253D%2525E6%2525A0%252587%2525E9%2525A2%252598-%2525E4%2525B8%2525BB%2525E6%2525A0%252587%2525E9%2525A2%252598%2526linkText%253D%2525E3%252580%252590%2525E6%252599%2525BA%2525E8%252581%252594%2525E6%25258B%25259B%2525E8%252581%252598%2525E3%252580%252591%2525E5%2525AE%252598%2525E6%252596%2525B9%2525E7%2525BD%252591%2525E7%2525AB%252599%252520%2525E2%252580%252593%252520%2525E5%2525A5%2525BD%2525E5%2525B7%2525A5%2525E4%2525BD%25259C%2525EF%2525BC%25258C%2525E4%2525B8%25258A%2525E6%252599%2525BA%2525E8%252581%252594%2525E6%25258B%25259B%2525E8%252581%252598%2525EF%2525BC%252581%2526linkType%253D; x_passport_sid=541d92b7se2e314fa8b1a827015f4a060547; ZP_OLD_FLAG=false; Hm_lvt_38ba284938d5eddca645bb5e02a02006=1617770545; LastCity=%E6%9D%AD%E5%B7%9E; LastCity%5Fid=653; ZPCITIESCLICKED=|653; ssxmod_itna=YqRx2DB7eQqrD7DzxA2Y=DkQGklKKK33G8Y00DBuGW4iNDnD8x7YDvmmEiIKGKYxxxvWxOGhewQEimhRfmdgmhr3YFrxB3DEx0=KqmGi4GGjxBYDQxAYDGDDPDocPD1D3qDkXxYPGW8qDbDiWkvxGCDeKD0xuFDQKDucKainIGkOA1tb5q48Gx6xG1i40Hmi8p3FSEinH3vx0k040OBOHkugYDUY2DNgLeZQFaqn2NeGDNqsiKiB0xWYhbK7x4/Ax3TCxe4D; ZL_REPORT_GLOBAL={%22//www%22:{%22seid%22:%224e39069e2fd04bd1886d920b2eb88eed%22%2C%22actionid%22:%225251163e-5979-4574-9670-222ac9a8a386-cityPage%22%2C%22funczone%22:%22city_hotjd%22}%2C%22jobs%22:{%22funczoneShare%22:%22dtl_best_for_you%22%2C%22recommandActionidShare%22:%221cae3ff7-762e-4708-b814-fc2d18caa64b-job%22}}; acw_tc=2760826e16177743233927099ef7353cfc99220ee9b0e1e5f11eb6671049f4; sts_sid=178aadb12ca86f-0f2166208f6b9a-c3f3568-1327104-178aadb12cb80f; sensorsdata2015jssdkcross=%7B%22distinct_id%22%3A%22177b9dd977f6f-020a8969613f07-53e3566-1327104-177b9dd9780b3b%22%2C%22first_id%22%3A%22%22%2C%22props%22%3A%7B%22%24latest_traffic_source_type%22%3A%22%E4%BB%98%E8%B4%B9%E5%B9%BF%E5%91%8A%E6%B5%81%E9%87%8F%22%2C%22%24latest_search_keyword%22%3A%22%E6%9C%AA%E5%8F%96%E5%88%B0%E5%80%BC_%E7%9B%B4%E6%8E%A5%E6%89%93%E5%BC%80%22%2C%22%24latest_referrer%22%3A%22%22%2C%22%24latest_utm_source%22%3A%22baidupcpz%22%2C%22%24latest_utm_medium%22%3A%22cpt%22%2C%22%24latest_utm_campaign%22%3A%22jl%22%2C%22%24latest_utm_content%22%3A%22tj%22%2C%22%24latest_utm_term%22%3A%2228757838%22%7D%2C%22%24device_id%22%3A%22177b9dd977f6f-020a8969613f07-53e3566-1327104-177b9dd9780b3b%22%7D; _uab_collina=161777469306311313996911; SL_GWPT_Show_Hide_tmp=1; SL_wptGlobTipTmp=1; 1420ba6bb40c9512e9642a1f8c243891=2720dea3-a6c1-4af6-ac23-cc817805a4d2; sts_evtseq=7; Hm_lpvt_38ba284938d5eddca645bb5e02a02006=1617774702; zp_passport_deepknow_sessionId=541d92b7se2e314fa8b1a827015f4a060547'
    }

url='https://passport.zhaopin.com/v4/account/login'
data={
    'passport':'1223',
    'password':'11122'
}
req=request.Request(url=url,headers=headers,data=parse.urlencode(data).encode('utf-8'),method='GET')
reqs=opener.open(req)
print(reqs.read().decode('utf-8'))

保存cookie到本地：

保存cookie到本地，可以使用cookiejar的save方法，并且需要指定一个文件名：

from urllib import request
from http.cookiejar import MozillaCookieJar

cookiejar = MozillaCookieJar("cookie.txt")
handler = request.HTTPCookieProcessor(cookiejar)
opener = request.build_opener(handler)

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36'
}
req = request.Request('http://httpbin.org/cookies',headers=headers)

resp = opener.open(req)
print(resp.read())
cookiejar.save(ignore_discard=True,ignore_expires=True)

从本地加载cookie：

从本地加载cookie，需要使用cookiejar的load方法，并且也需要指定方法：

from urllib import request
from http.cookiejar import MozillaCookieJar

cookiejar = MozillaCookieJar("cookie.txt")
cookiejar.load(ignore_expires=True,ignore_discard=True)
handler = request.HTTPCookieProcessor(cookiejar)
opener = request.build_opener(handler)

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36'
}
req = request.Request('http://httpbin.org/cookies',headers=headers)

resp = opener.open(req)
print(resp.read())

requests库

虽然Python的标准库中 urllib模块已经包含了平常我们使用的大多数功能，但是它的 API 使用起来让人感觉不太好，而 Requests宣传是 “HTTP for Humans”，说明使用更简洁方便。

发送GET请求：

最简单的发送get请求就是通过requests.get来调用：
```
response = requests.get("http://www.baidu.com/")
```

添加headers和查询参数：
如果想添加 headers，可以传入headers参数来增加请求头中的headers信息。如果要将参数放在url中传递，可以利用 params 参数。相关示例代码如下：

 import requests

 kw = {'wd':'中国'}

 headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/54.0.2840.99 Safari/537.36"}

 # params 接收一个字典或者字符串的查询参数，字典类型自动转换为url编码，不需要urlencode()
 response = requests.get("http://www.baidu.com/s", params = kw, headers = headers)

 # 查看响应内容，response.text 返回的是Unicode格式的数据
 print(response.text)

 # 查看响应内容，response.content返回的字节流数据
 print(response.content)

 # 查看完整url地址
 print(response.url)

 # 查看响应头部字符编码
 print(response.encoding)

 # 响应数据为json数据，可直接拿到字典数据
 response.json

 # 查看响应码
 print(response.status_code)

发送POST请求：

最基本的POST请求可以使用post方法：

response = requests.post("http://www.baidu.com/",data=data)

传入data数据：
这时候就不要再使用urlencode进行编码了，直接传入一个字典进去就可以了。比如请求拉勾网的数据的代码：

 import requests

 url = "https://www.lagou.com/jobs/positionAjax.json?city=%E6%B7%B1%E5%9C%B3&needAddtionalResult=false&isSchoolJob=0"

 headers = {
     'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36',
     'Referer': 'https://www.lagou.com/jobs/list_python?labelWords=&fromSearch=true&suginput='
 }

 data = {
     'first': 'true',
     'pn': 1,
     'kd': 'python'
 }

 resp = requests.post(url,headers=headers,data=data)
 # 如果是json数据，直接可以调用json方法
 print(resp.json())

使用代理：

使用requests添加代理也非常简单，只要在请求的方法中（比如get或者post）传递proxies参数就可以了。示例代码如下：

import requests

url = "http://httpbin.org/get"

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36',
}

proxy = {
    'http': '171.14.209.180:27829'
}

resp = requests.get(url,headers=headers,proxies=proxy)
with open('xx.html','w',encoding='utf-8') as fp:
    fp.write(resp.text)

如果在一个响应中包含了cookie，那么可以利用cookies属性拿到这个返回的cookie值：

import requests

url = "http://www.renren.com/PLogin.do"
data = {"email":"970138074@qq.com",'password':"pythonspider"}
resp = requests.get('http://www.baidu.com/')
print(resp.cookies)
# 以字典形式返回
print(resp.cookies.get_dict())

session：

之前使用urllib库，是可以使用opener发送多个请求，多个请求之间是可以共享cookie的。那么如果使用requests，也要达到共享cookie的目的，那么可以使用requests库给我们提供的session对象。注意，这里的session不是web开发中的那个session，这个地方只是一个会话的对象而已。还是以登录人人网为例，使用requests来实现。示例代码如下：

import requests

url = "http://www.renren.com/PLogin.do"
data = {"email":"970138074@qq.com",'password':"pythonspider"}
headers = {
    'User-Agent': "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.94 Safari/537.36"
}

# 登录
session = requests.session()
session.post(url,data=data,headers=headers)

# 访问大鹏个人中心
resp = session.get('http://www.renren.com/880151247/profile')

print(resp.text)

处理不信任的SSL证书：

对于那些已经被信任的SSL整数的网站，比如https://www.baidu.com/，那么使用requests直接就可以正常的返回响应。示例代码如下：

resp = requests.get('http://www.12306.cn/mormhweb/',verify=False)
print(resp.content.decode('utf-8'))

注：以上学习内容本人整理于网易课堂自费购买课程，目的就是做个笔记防止自己忘记，联系侵删！！！

posted @ 2021-04-06 22:10 cheney-pro 阅读(1905) 评论(0) 编辑收藏举报

刷新页面返回顶部

Loading

cheney-pro