【发布时间】:2011-11-20 01:42:09
【问题描述】:
我会自动将 HTML 页面的内容翻译成不同的语言,因此我必须从不同的 HTML 页面中提取所有文本节点,这些页面有时写得不好(我无法编辑这些 HTML)。
通过使用 BeautifulSoup,我可以轻松提取这些文本并用翻译替换它,但是当我在这些操作之后显示 HTML 时: html = BeautifulSoup(source_html) - 它有时会因为 BeautifulSoup 自动关闭标签而损坏(例如表标签在错误的位置关闭) .
有没有办法阻止 BeautifulSoup 关闭这些标签?
例如这是我的输入:
html = "<table><tr><td>some text</td></table>" - 缺少关闭 tr
在汤 = BeautufulSoup(html) 之后我得到 "<table><tr><td>some text</td></tr></table>"
我想获得与输入完全相同的 html...
有可能吗?
【问题讨论】:
-
例如这是我的输入: html = "some text" - 在 soup = BeautufulSoup(html) 之后缺少关闭 tr 我得到“一些文本”并且我想获得与输入相同的 html ...有可能吗?
-
要添加示例,请更新您的问题并确保将其格式化为代码,否则标签将不会显示。
标签: python parsing html-parsing beautifulsoup