老兵笔记-郑昀

参与软件开发这些年来，不断地遇到新领域新知识点，屡屡感受到新进入者的迷惑和彷徨，所以对遇到的每一个问题都详细记录问题现象、解决思路以及解决方案，并在blog中留下印迹，以备他日有心人google之而知之。
你们的新手之痛，你们的新业务发展之初的思路混沌，我都感同身受，所以欢迎和我一起探讨，知无不言言无不尽。

随笔 - 634 文章 - 0 评论 - 1223 阅读 - 316万

描述如何从网页提取结构化数据的语言：Parsley

郑昀@玩聚SR 20091127

Scrapy里面用到了Parsley。
Parsley是一个挺有意思的小东西，它综合运用了CSS、XPath、正则表达式和JSON，是描述如何从网页里提取结构化数据的简单语言。估计做爬虫(Crawler/Spider)的人都会定义一套类似的模板。只不过Parsley还帮你把具体实现做了，用各种开发语言。

基本事实

Parselets就是用Parsley语言写成的片段(snippets)。

你可以近似认为一个Parselet定义了一套动作，描述如何从html代码中精确抽取数据，比如标题在哪儿，标题的链接怎么拿，评论数在哪儿如何提取。

Parsley有各种语言实现包，Ruby、Python、C/C++等。
pyparsley是对应的Python库。

Code和Result示例

具体例子参见：http://parselets.com/parselets/yc/15 ，

Code

左侧的Code就是我们通常说的模板，右边的Result就是提取的结构化数据。

那么它是如何变为现实的呢？

实现

安装Parsley，再安装http://github.com/fizx/pyparsley，然后运行如下Python代码，就可以从给定网页链接，通过Parselet的描述，获得json格式的结构化数据。

Python

zhengyun 20091127 beijing

posted @ 2009-11-27 23:57 老兵笔记阅读(2336) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

【推荐】还在用 ECharts 开发大屏？试试这款永久免费的开源 BI 工具！
【推荐】国内首个AI IDE，深度理解中文开发场景，立即下载体验Trae
【推荐】编程新体验，更懂你的AI，立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包，你的智能百科全书，全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell：AI 加持，快人一步

编辑推荐：
· 如何编写易于单元测试的代码
· 10年+ .NET Coder 心语，封装的思维：从隐藏、稳定开始理解其本质意义
· .NET Core 中如何实现缓存的预热？
· 从 HTTP 原因短语缺失研究 HTTP/2 和 HTTP/3 的设计差异
· AI与.NET技术实操系列：向量存储与相似性搜索在 .NET 中的实现

阅读排行：
· 周边上新：园子的第一款马克杯温暖上架
· Open-Sora 2.0 重磅开源！
· .NET周刊【3月第1期 2025-03-02】
· 分享 3 个 .NET 开源的文件压缩处理库，助力快速实现文件压缩解压功能！
· Ollama——大语言模型本地部署的极速利器