Python爬虫----Beautiful Soup4 基础

1. Beautiful Soup简介

简单来说，Beautiful Soup是python的一个库，最主要的功能是从网页抓取数据。官方解释如下：

Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱，通过解析文档为用户提供需要抓取的数据，因为简单，所以不需要多少代码就可以写出一个完整的应用程序。

Beautiful Soup自动将输入文档转换为Unicode编码，输出文档转换为utf-8编码。你不需要考虑编码方式，除非文档没有指定一个编码方式，这时，Beautiful Soup就不能自动识别编码方式了。然后，你仅仅需要说明一下原始编码方式就可以了。

Beautiful Soup已成为和lxml、html6lib一样出色的python解释器，为用户灵活地提供不同的解析策略或强劲的速度。

2. Beautiful Soup安装

可以利用 pip 或者 easy_install 来安装

easy_install beautifulsoup4 pip install beautifulsoup4

3. 开启Beautiful Soup 之旅

官方文档

4. Beautiful Soup笔记

注：

bs=BeautifulSop(html,'html.parser') //Beautiful Soup支持Python标准库中的HTML解析器

title1是list //列表

title2是bs4.element.Tag //元素标签

5. Beautiful Soup实战爬虫

 1 #coding:utf-8
 2 from bs4 import BeautifulSoup
 3 import requests
 4 html = requests.get('https://news.jin10.com/')
 5 html.encoding='utf-8' #设定编码
 6 html=html.text
 7 def title(url):
 8     bs= BeautifulSoup(url,'html.parser')
 9     title=bs.select('.jin-slider_title')
10     for titles in title:
11         print titles.text
12         print "\n"
13 title(html)

posted @ 2017-01-11 16:36 archie’s 阅读(602) 评论(0) 收藏举报

刷新页面返回顶部

Archie