毕业设计每日博客--星期二

今天完成了第二层链接爬取的设计,在爬取时发现了一个问题,爬取全部的链接,足足有几百万条可能更多,而使用谷歌驱动的缺点就是,爬取速度特别慢,如果网速差的话更慢,再加上防止知网访问频繁的验证码问题,必需加上休眠,如果要爬取所有链接,运行22天不断才能爬取完成,这还只是链接,所以准备修改代码,每一个专辑只爬取少量链接,这样下来也有10万条数据,相信足够了。

posted @ 2020-09-29 18:24    阅读(94)  评论(0编辑  收藏  举报