Python爬取百度搜索结果页面并输出标题和链接

# 爬取百度10页的标题

import urllib.request
import re
import urllib.parse
from bs4 import BeautifulSoup

def build_onepage_crawl_function(keyword, number_of_page):
    #构建请求头
    user_agent_header = ("User-Agent","Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:78.0) Gecko/20100101 Firefox/78.0)")
    opener_build = urllib.request.build_opener()
    opener_build.addheaders = [user_agent_header]
    #对搜索关键词进行编码
    encoded_keyword = urllib.parse.quote(keyword) 
    # 通过for循环爬去每一页
    for i in range(int(number_of_page)):
        url = "https://www.baidu.com"
        number_of_page = i * 10 # 构造 &pn=
        print("百度搜索页面链接:",number_of_page)
        url = url + "/s?wd=" + encoded_keyword + "&pn=" + str(number_of_page) # 完整的url包括关键词说页数,这里keyword本身就是str
        print(url)
        #构造get请求中的url
        original_html = opener_build.open(url, timeout = 2).read().decode("utf-8","ignore")
        soup = BeautifulSoup(original_html ,'html.parser')
        for title in soup.select('.tts-title a'):
            print(title.text)
    
#输入关键词以及需要爬取的页数
keyword_input = input("请输入关键词：")
number_of_page_input = input("请输入页数：")
build_onepage_crawl_function(keyword_input, number_of_page_input)

posted @ 2022-05-13 13:50 极客船长阅读(508) 评论(0) 编辑收藏举报

会员力量，点亮园子希望

刷新页面返回顶部

极客船长

Python爬取百度搜索结果页面并输出标题和链接

公告