Python爬虫入门案例：爬取某网站付费文档内容保存PDF

知识点：

requests
css选择器

第三方库：

requests >>> pip install requests
parsel >>> pip install parsel
pdfkit >>> pip install pdfkit

开发环境：

版本：anaconda5.2.0（python3.6.5）
编辑器：pycharm (安装包/安装教程/激活码/使用教程/插件[翻译插件/主题/汉化包])
软件环境: wkhtmltopdf 把html文件转成pdf

【付费VIP完整版】只要看了就能学会的教程，80集Python基础入门视频教学

本节课上课流程思路:

一. 数据来源分析

确定要爬目标: 文档内容
这些文档数据内容是可以从哪里获取的
分析数据的过程:

鼠标右键点击检查或者F12 打开开发者工具选择 network
通过开发者工具进行搜索(相关一些数据) 虽然返回数据 (字体编码)
搜索没有返回数据可以查看本身网址发送请求服务器返回的数据内容
分析多个文章的url地址区别请求url地址情况

二. 代码实现过程

发送请求, 对于文章列表页面发送请求
获取数据, 获取网页源代码
解析数据, 提取文章url地址或者文章标题
发送请求, 对于文章详情页url地址发送请求
获取数据, 获取网页源代码
解析数据, 提取文章内容
保存数据, 保存成html文件内容
保存PDF, 需要把html文件转成PDF文件内容
多页爬取

导入模块

import requests # 数据请求模块 第三方模块 pip install requests 在CMD里面即可安装
import parsel # 数据解析模块 第三方模块 pip install parsel
import os # 文件操作模块 内置模块
import pdfkit

1. 发送请求, 对于文章列表页面发送请求

# 请求url地址
url = 'https://www.chinawenwang.com/zlist-55-1.html'
# 携带请求头参数 headers 请求头是字典类型 键值对形式 一个关键字对应值 中间是用:隔开的
# User-Agent 浏览器的基本信息
# 请求头是为了把python代码伪装成浏览器对于服务器发送请求 (披着羊皮狼)
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/93.0.4577.63 Safari/537.36'
}
# 请求方式: 常见 get请求 post请求
response = requests.get(url=url, headers=headers)
# <Response [200]> response响应对象 <> 200 状态码 表示请求成功
# 获取的是响应体的文本数据 (乱码) 转码

2. 获取数据, 获取网页源代码 response.text (html字符串数据内容)

print(response.text)

3. 解析数据, 提取文章url地址或者文章标题

# 解析数据方法: re正则表达式[可以直接匹配字符串数据内容] css选择器 xpath (对于html字符串数据进行数据转换)
# 如果你是想要从事相关工作 招聘需求有一个要求 re css xpath 都要会
selector = parsel.Selector(response.text) # 把html字符串数据进行数据转换 selector 对象
# attr(href) 属性选择器 获取a标签里面的href属性 css语法 在VIP课程都一节课内容 (2.5小时内容)
# getall() 获取所有 返回列表  匹配多个数据 都是返回列表
href = selector.css('.d-flex h2 a::attr(href)').getall()[:-2]

4. 发送请求, 对于文章详情页url地址发送请求

for index in href:
    response_1 = requests.get(url=index, headers=headers)

5. 获取数据, 获取网页源代码

print(response_1.text)

6. 解析数据, 提取文章内容

selector_1 = parsel.Selector(response_1.text)

获取文章标题 get() 获取一个返回的字符串数据

title = selector_1.css('.content-page-header-div h1::text').get()
content = selector_1.css('.content-page-main-content-div').get()
html_content = html_str.format(article=content)

7. 保存数据, 保存成html文件内容

# 文件路径以及文件名后缀
html_path = html_filename + title + '.html'
pdf_path = pdf_filename + title + '.pdf'
with open(html_path, mode='w', encoding='utf-8') as  f:
    f.write(html_content)

8. 保存PDF, 需要把html文件转成PDF文件内容

# 配置软件 指定软件位置
config = pdfkit.configuration(wkhtmltopdf=r'C:\Program Files\wkhtmltopdf\bin\wkhtmltopdf.exe')
# 把html文件里面的内容 转成pdf 保存到 pdf文件夹
pdfkit.from_file(html_path, pdf_path, configuration=config)
print('正在保存: ', title)

对于本篇文章有疑问的同学也可以点这里

posted @ 2021-09-16 16:12 松鼠爱吃饼干阅读(3328) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

阅读排行：
· 全程不用写代码，我用AI程序员写了一个飞机大战
· DeepSeek 开源周回顾「GitHub 热点速览」
· 记一次.NET内存居高不下排查解决与启示
· MongoDB 8.0这个新功能碉堡了，比商业数据库还牛
· .NET10 - 预览版1新功能体验（一）

公告

p y t h o n 学习交流裙 7 5 3 1 8 8 3 8 7 Python基础入门视频教程，点击即可观看

昵称：松鼠爱吃饼干
园龄： 3年11个月
粉丝： 56
关注： 0

+加关注

2025年3月

日

一

二

三

四

五

六

随笔分类

Python爬虫案例分享(58)

松鼠爱吃饼干

源码、资料分享、问题解答群：753182387

Python爬虫入门案例：爬取某网站付费文档内容保存PDF

知识点：

第三方库：

开发环境：

【付费VIP完整版】只要看了就能学会的教程，80集Python基础入门视频教学

本节课上课流程思路:

一. 数据来源分析

二. 代码实现过程

导入模块

1. 发送请求, 对于文章列表页面发送请求

2. 获取数据, 获取网页源代码 response.text (html字符串数据内容)

3. 解析数据, 提取文章url地址或者文章标题

4. 发送请求, 对于文章详情页url地址发送请求

5. 获取数据, 获取网页源代码

6. 解析数据, 提取文章内容

获取文章标题 get() 获取一个返回的字符串数据

7. 保存数据, 保存成html文件内容

8. 保存PDF, 需要把html文件转成PDF文件内容

对于本篇文章有疑问的同学也可以点这里

公告

搜索

我的标签

积分与排名

随笔分类

随笔档案

阅读排行榜

评论排行榜

推荐排行榜

源码、资料分享、问题解答群：753182387

知识点：

第三方库：

开发环境：

本节课上课流程思路:

一. 数据来源分析

二. 代码实现过程

导入模块

1. 发送请求, 对于文章列表页面发送请求

2. 获取数据, 获取网页源代码 response.text (html字符串数据内容)

3. 解析数据, 提取文章url地址或者文章标题

4. 发送请求, 对于文章详情页url地址发送请求

5. 获取数据, 获取网页源代码

6. 解析数据, 提取文章内容

获取文章标题 get() 获取一个 返回的字符串数据

7. 保存数据, 保存成html文件内容

8. 保存PDF, 需要把html文件转成PDF文件内容

公告

搜索

积分与排名

随笔档案

获取文章标题 get() 获取一个返回的字符串数据