【发布时间】:2009-11-26 10:30:44
【问题描述】:
如何轻松提取仅嵌入在 html 页面中的网页内容(如 img、pdf、flv、doc、rtf、wmc 等),而不是 css 和 css 背景图像、javascript。
我正在将内容旧网站迁移到新网站。重新上传所有图片、链接的 pdf、flv 等。
【问题讨论】:
如何轻松提取仅嵌入在 html 页面中的网页内容(如 img、pdf、flv、doc、rtf、wmc 等),而不是 css 和 css 背景图像、javascript。
我正在将内容旧网站迁移到新网站。重新上传所有图片、链接的 pdf、flv 等。
【问题讨论】:
如果您使用过 XHTML,则可以使用普通的 XML-Parser。
【讨论】:
BeautifulSoup 类 op python 是一个非常好的解析器,在执行此类操作时非常方便。
【讨论】:
为此,您需要一个 HTML 解析器。在 Perl 中,有 HTML::Parser 模块。
【讨论】:
【讨论】: