随笔分类 - 我爬爬爬
综合设计——多源异构数据采集与融合应用综合实践
摘要:1. 基本信息 这个项目属于哪个课程 2023数据采集与融合技术 组名 冲就完事 项目简介 当我们置身于日常生活或旅途中,常会被美景所震撼,但往往难以找到合适的诗句来表达内心的感悟。为了传承中华传统文化、提升人们的诗词修养和表达能力,我们需要一个智能系统能够根据用户拍摄的照片,自动匹配相应的诗句,并
2023数据采集与融合技术实践第四次作业
摘要:作业①: 要求: 熟练掌握 Selenium 查找 HTML 元素、爬取 Ajax 网页数据、等待 HTML 元素等内容。使用 Selenium 框架+ MySQL 数据库存储技术路线爬取“沪深 A 股”、“上证 A 股”、“深证 A 股”3 个板块的股票数据信息。 输出信息: MYSQL 数据库存
2023数据采集与融合技术实践第三次作业
摘要:作业①: 要求: 指定一个网站,爬取这个网站中的所有的所有图片,例如:中国气象网(http://www.weather.com.cn)。使用scrapy框架分别实现单线程和多线程的方式爬取。 –务必控制总页数(学号尾数2位)、总下载的图片数量(尾数后3位)等限制爬取的措施。 输出信息: 将下载的Ur
2023数据采集与融合技术实践第二次作业
摘要:作业①: 要求: 在中国气象网(http://www.weather.com.cn)给定城市集的 7日天气预报,并保存在数据库。 代码: 核心程序 soup = BeautifulSoup(data, "lxml") lis = soup.select("ul[class='t clearfix']
爬虫记录~(多线程爬取图片)
摘要:要求: 使用Requests+Re库方法多线程爬取亚马逊商城商品图片,以关键词“书包”搜索页面的商品的图片,爬取0-2页面商品图片。 关键词: 多线程爬虫程序、商城网站的遍历,链接的查找和访问。巩固搜索接口和翻页处理。 代码: 获取图片数据 def get_pagelist(pagenum): ur
2023数据采集与融合技术实践第一次作业
摘要:作业①: 要求: 用requests和BeautifulSoup库方法定向爬取给定网址(http://www.shanghairanking.cn/rankings/bcur/2020 )的数据,屏幕打印爬取的大学排名信息。 输出信息: 排名 学校名称 省市 学校类型 总分 1 清华大学 北京 综合