python识别网站所用技术

  最近在学习一些python爬虫,我们要爬取一个站点,首先要去查看网站的robots协议,如果明确禁止抓取了要遵守,否则可能会带来麻烦。第二步我们要知道网站是用什么技术做的,如何通过python的方法来识别呢?可以用builtwith库来实现(注意是builtwith不是buildwith),当然前提是安装了python

  安装方法,win+r,cmd,输入如下代码

1
pip install builtwith

  如果已经安装好了,会出现下面的提示

 

  进入python

1
2
3
import builtwith
 
builtwith.parse('https://abc.com')

  显示如下

 

   但builtwith毕竟是机器判断,有时不一定正确,只可作为参考

1
2
3
import builtwith
 
builtwith.parse('https://www.cnblogs.com/ytkah')

  运行结果如下,但是不一定准确

 

   ytkah最近写了比较多的woocommerce文章,所以它判断是wordpress创建的,其实这个是博客园的博客系统,是.net制作的,主页的底部就可以看到

 

   感兴趣的朋友可以安装测试一下

 

 

  

posted @   ytkah  阅读(509)  评论(0编辑  收藏  举报
编辑推荐:
· 10年+ .NET Coder 心语,封装的思维:从隐藏、稳定开始理解其本质意义
· .NET Core 中如何实现缓存的预热?
· 从 HTTP 原因短语缺失研究 HTTP/2 和 HTTP/3 的设计差异
· AI与.NET技术实操系列:向量存储与相似性搜索在 .NET 中的实现
· 基于Microsoft.Extensions.AI核心库实现RAG应用
阅读排行:
· 10年+ .NET Coder 心语 ── 封装的思维:从隐藏、稳定开始理解其本质意义
· 地球OL攻略 —— 某应届生求职总结
· 提示词工程——AI应用必不可少的技术
· Open-Sora 2.0 重磅开源!
· 周边上新:园子的第一款马克杯温暖上架
历史上的今天:
2015-02-26 微信公众号推荐(自己关注的微信公众平台导航)
网址导航 gg N / G Sitemap

部分内容来源于网络,如有版权问题请联系删除

  
点击右上角即可分享
微信分享提示