【问题标题】:How to extract content of web pages easily which are embeded in html pages inside <body>?如何轻松提取嵌入在<body>内的html页面中的网页内容?
【发布时间】:2009-11-26 10:30:44
【问题描述】:

如何轻松提取仅嵌入在 html 页面中的网页内容(如 img、pdf、flv、doc、rtf、wmc 等),而不是 css 和 css 背景图像、javascript。

我正在将内容旧网站迁移到新网站。重新上传所有图片、链接的 pdf、flv 等。

【问题讨论】:

    标签: css xhtml


    【解决方案1】:

    如果您使用过 XHTML,则可以使用普通的 XML-Parser。

    【讨论】:

      【解决方案2】:

      BeautifulSoup 类 op python 是一个非常好的解析器,在执行此类操作时非常方便。

      【讨论】:

      • 对不起,我不明白你的问题
      【解决方案3】:

      为此,您需要一个 HTML 解析器。在 Perl 中,有 HTML::Parser 模块。

      【讨论】:

        【解决方案4】:
        1. 您可以将 firefox 的 Firebug 插件用于只读目的。
        2. 您可以使用以下方法构建您的自定义应用程序:
          http://www.codeplex.com/htmlagilitypack

        【讨论】:

          猜你喜欢
          • 2012-02-11
          • 2012-07-10
          • 1970-01-01
          • 1970-01-01
          • 2011-10-12
          • 1970-01-01
          • 2011-03-22
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多