网络采集软件核心技术剖析系列（3）---如何使用C#语言下载博文中的全部图片到本地并可以离线浏览

private void GetSrcLinks()
        {
            HtmlNodeCollection atts = m_Doc.DocumentNode.SelectNodes("//*[@src]");
            if (Equals(atts, null))
            {
                return;
            }

            Links = atts.
                SelectMany(n => new[]
                    {
                        ParseLink(n, "src"),

                    }).
                Distinct().
                ToArray();
        }

通过HtmlAgilityPack中的HtmlDocument类找出全部src属性的节点，再通过linq提取出其中的网页地址。

2.对于每一个图片链接地址，下载该图片到本地，如下代码所示：

 DocumentWithLinks links = htmlDoc.GetSrcLinks();
            int i = 1;
            string baseUrl = new Uri(strLink).GetLeftPart(UriPartial.Authority);

            foreach (string strPicLink in links.Links)
            {
                if (string.IsNullOrEmpty(strPicLink))
                {
                    continue;
                }
          
                try
                {
                    string strExtension = System.IO.Path.GetExtension(strPicLink);

                    if (strExtension == ".js" || strExtension == ".swf")
                        continue;
                  
                    if (strExtension == "")
                    {
                        strExtension = ".jpg";
                    }

                    string normalizedPicLink = GetNormalizedLink(baseUrl, strPicLink);
                    strNewPage = DownLoadPicInternal(wc, strNewPage, strPageTitle, strPicLink, normalizedPicLink, strExtension, ref i);
                }
                catch (Exception ex)
                {
                } //end try
            }

其中 DownLoadPicInternal的实现代码如下：

protected string DownLoadPicInternal(WebClient wc, string strNewPage, string strPageTitle, string strPicLink
                               , string strTureLink, string strExtension, ref int i)
        {
            strPageTitle = strPageTitle.Replace("\\", "").Replace("/", "").Replace(":", "").Replace("*", "").Replace("?", "")
            .Replace("\"", "").Replace("<", "").Replace(">", "").Replace("|", "");
            strPageTitle = Regex.Replace(strPageTitle, @"[|•/\;.':*?<>-]", "").ToString();
            strPageTitle = Regex.Replace(strPageTitle, "[\"]", "").ToString();
            strPageTitle = Regex.Replace(strPageTitle, @"\s", "");

            if (!Directory.Exists(Application.StartupPath + "\\" + strPageTitle))//判断是否存在
            {
                Directory.CreateDirectory(Application.StartupPath + "\\" + strPageTitle);//创建新路径
            }
           
            int[] nArrayOffset = new int[2];
            nArrayOffset = m_bf.getOffset(strPicLink);
            strNewPage = strNewPage.Replace(strPicLink, nArrayOffset[0].ToString() + nArrayOffset[1].ToString() + strExtension);
            string strSavedPicPath = Path.Combine(strPageTitle, nArrayOffset[0].ToString() + nArrayOffset[1].ToString() + strExtension);
        

            PrintLog(" 开始下载文章 [" + strPageTitle + "] 的第" + i.ToString() + "张图片\n");
            strTureLink = HttpUtility.UrlDecode(strTureLink);
            wc.DownloadFile(strTureLink, Application.StartupPath + "\\" + strSavedPicPath);
            PrintLog(" 下载完成文章 [" + strPageTitle + "] 的第" + i.ToString() + "张图片\n");
            System.Threading.Thread.Sleep(300);
            i++;
            return strNewPage;

        }

其中粉色代码部分m_bf变量是BloomFilter类型的一个对象，BloomFilter是一个网页去重的强大工具，这里是为了将图片链接转化为一个独一无二的文件名。

strNewPage = strNewPage.Replace(strPicLink, nArrayOffset[0].ToString() + nArrayOffset[1].ToString() + strExtension);

此行代码是用新的图片文件名替换原网页中的图片链接。其他部分的代码之前章节均有解释，请自行参考。

3.第二步全部图片下载完成后，将所有图片链接替换后的网页正文保存为一个新的html文件（index.html），主要代码如下：

  strPageTitle = strPageTitle.Replace("\\", "").Replace("/", "").Replace(":", "").Replace("*", "").Replace("?", "")
             .Replace("\"", "").Replace("<", "").Replace(">", "").Replace("|", "");
            strPageTitle = Regex.Replace(strPageTitle, @"[|•/\;.':*?<>-]", "").ToString();
            strPageTitle = Regex.Replace(strPageTitle, "[\"]", "").ToString();
            strPageTitle = Regex.Replace(strPageTitle, @"\s", "");


            File.WriteAllText(Path.Combine(strPageTitle, "index.html"), strNewPage, Encoding.UTF8);

上面的一堆替换是因为windows对文件夹名有要求---不能包含一些特殊字符，这里我们通过正则替换去掉这些特殊字符。

到此为止，我们就实现了将任意网页中的正文中的图片下载到本地的功能，并同时修改了原来网页正文中的图片链接，以达到可以离线浏览的目的。

以后的生成pdf，chm均以此为基础，这一节是重中之重，有兴趣的同学可以扩展我提供的代码，将它改造成某个站点的图片采集器应该也是一件简单的事情。

四下节预告

使用C#语言如何将html网页转换成pdf（html2pdf）。

作者：宋波
出处：http://www.cnblogs.com/ice-river/
本文版权归作者和博客园共有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文链接。
正在看本人博客的这位童鞋，我看你气度不凡，谈吐间隐隐有王者之气，日后必有一番作为！旁边有“推荐”二字，你就顺手把它点了吧，相得准，我分文不收；相不准，你也好回来找我！

posted @ 2014-11-24 18:01 际为软件事务所阅读(2386) 评论(5) 编辑收藏举报

刷新页面返回顶部

际为软件事务所

风云际会有所作为

网络采集软件核心技术剖析系列（3）---如何使用C#语言下载博文中的全部图片到本地并可以离线浏览

公告

际为软件事务所

风云际会 有所作为

网络采集软件核心技术剖析系列（3）---如何使用C#语言下载博文中的全部图片到本地并可以离线浏览

公告

风云际会有所作为