C#使用NSoup解析HTML的乱码解决

NSoup是JSoup的Net移植版本。使用方法基本一致。

如果项目涉及HTML的处理，强烈推荐NSoup，毕竟字符串截断太苦逼了。

下载地址：

http://nsoup.codeplex.com/

简单用法如下：

1	`NSoup.Nodes.Document doc = NSoup.NSoupClient.Parse(HtmlString);`

处理网络上的页面：

1	`NSoup.Nodes.Document doc = NSoup.NSoupClient.Connect("http://www.cnblogs.com/htynkn/").Get();`

但是遗憾的是NSoup默认的编码是UTF-8，处理中文有乱码（对于编码是UTF-8的自然不会有乱码，但是有些GB2312的就可能有乱码，谢谢 forhells的提醒）。

目前我找到两种解决办法：

1.下载网页源代码再处理

WebClient webClient = new WebClient();
String HtmlString=Encoding.GetEncoding("utf-8").GetString(webClient.DownloadData("http://www.cnblogs.com/htynkn/"));
NSoup.Nodes.Document doc = NSoup.NSoupClient.Parse(HtmlString);

2.获得网页的流

1 2	`WebRequest webRequest=WebRequest.Create("http://www.cnblogs.com/htynkn/");` `NSoup.Nodes.Document doc = NSoup.NSoupClient.Parse(webRequest.GetResponse().GetResponseStream(),"utf-8");`

第二种用着比较方便，但是我觉得第一种比较合适，毕竟NSoup是个Html解析类，下载网页代码这种事情本来不应该交给它。

posted @ 2011-11-05 19:06 夜明的孤行灯阅读(4942) 评论(8) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

阅读排行：
· 物流快递公司核心技术能力-地址解析分单基础技术分享
· .NET 10首个预览版发布：重大改进与新特性概览！
· 单线程的Redis速度为什么快？
· 展开说说关于C#中ORM框架的用法！
· Pantheons：用 TypeScript 打造主流大模型对话的一站式集成库

公告

昵称：夜明的孤行灯
园龄： 14年1个月
粉丝： 333
关注： 6

+加关注

2011年11月

日

一

二

三

四

五

六

夜明的孤行灯

博客已迁移，请访问：http://www.huangyunkun.com/

C#使用NSoup解析HTML的乱码解决

公告

搜索

常用链接

我的标签

积分与排名

随笔分类

随笔档案

常用链接

阅读排行榜

评论排行榜

推荐排行榜

最新评论