摘要: 今天完成了第二层链接爬取的设计,在爬取时发现了一个问题,爬取全部的链接,足足有几百万条可能更多,而使用谷歌驱动的缺点就是,爬取速度特别慢,如果网速差的话更慢,再加上防止知网访问频繁的验证码问题,必需加上休眠,如果要爬取所有链接,运行22天不断才能爬取完成,这还只是链接,所以准备修改代码,每一个专辑只 阅读全文
posted @ 2020-09-29 18:24 集 阅读(94) 评论(0) 推荐(0) 编辑