团队-张宸-需求分析-python爬虫分类爬取豆瓣电影

首先要明白爬网页实际上就是:

  1. 找到包含我们需要的信息的网址(URL)列表
  2. 通过 HTTP 协议把页面下载回来
  3. 从页面的 HTML 中解析出需要的信息
  4. 找到更多这个的 URL,回到 2 继续

其次还要明白:

一个好的列表应该:

  • 包含足够多的电影的 URL
  • 通过翻页,可以遍历到所有的电影
  • 一个按照更新时间排序的列表,可以更快抓到最新更新的电影

最后模拟过程知道豆瓣网站不能一次性爬取所有信息,只能分类爬取

使用工具pyspider

分析完成实现代码,测试模拟运行,按照时间列表爬取每类最新电影资讯

团队成员:张文然,张宸

posted @ 2017-09-07 17:56  张宸Stevenson  阅读(55)  评论(0编辑  收藏  举报