【发布时间】:2010-10-21 05:47:32
【问题描述】:
我正在使用 BeautifulSoup 和 urllib2 下载 HTML 页面并对其进行解析。问题在于格式错误的 HTML 页面。虽然 BeautifulSoup 擅长处理格式错误的 HTML,但它仍然不如 Firefox。
考虑到 Firefox 或 Webkit 在处理 HTML 时更新和弹性更高,我认为使用它们来构建和规范化页面的 DOM 树,然后通过 Python 操作它是理想的。
但是我找不到任何相同的 python 绑定。任何人都可以建议一种方法吗?
我遇到了一些运行无头 Firefox 进程并通过 python 操作它的解决方案,但是否有更 Pythonic 的解决方案可用。
【问题讨论】:
-
可能是因为您正在使用漂亮的汤 3.1,“在现实世界的 HTML 上比 3.0.7a 版本更糟糕”?[1] 最近我不得不自己解析一些东西,发现 3.0 .7 确实处理得更好。使用 easy_install 切换到 3.0.7a:sudo easy_install beautifulsoup==3.0.7a [1] crummy.com/software/BeautifulSoup/3.1-problems.html