Python爬虫项目,获取所有网站上的新闻,并保存到数据库中,解析html网页等
1、需求说明
需求:
爬取虎嗅网站的所有新闻,并保存到数据库中。
http://www.huxiu.com
技术:
1、爬虫
获取服务器的资源(urllib)
解析html网页(BeautifulSoup)
2、数据库技术
数据库 MySQLdb
业务逻辑的分析:
(1)、虎嗅网站的新闻,包括首页和分页信息(下一页)
(2)、需要从首页的资源和分页的资源中获取每个新闻的url连接
如何获取url:
解析网站html文件,如果A标签的href属性包含 article字段,就表示这是一个新闻
(3)访问新闻的url,解析出想要的字段
http://www.woaipu.com/shops/zuzhuan/61406
http://www.woaipu.com/shops/zuzhuan/61406
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】凌霞软件回馈社区,博客园 & 1Panel & Halo 联合会员上线
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步