【发布时间】:2012-06-24 10:41:48
【问题描述】:
我需要在运行时在服务器端从随机网页中提取纯文本。我使用 Google App Engine 和 Readability python 端口。 有很多。
- 早期version by gfxmonk,基于 BeautifulSoup
- version by minvolai 基于 gfxmonk 的除了使用 lxml 而不是 BeautifulSoap,使其(根据 minvolai,请参阅项目页面)更快,尽管引入了对 lxml 的依赖。
- version by Yuri Baburov aka buriy。与 minvolai 相同,取决于 lxml。还依赖chardet 来检测编码。
我使用 Yuri 的版本,因为它是最新的,并且似乎正在积极开发中。 我设法使用 Python 2.7 让它在 Google App Engine 上运行。 现在的“问题”是它返回 HTML,而我需要纯文本。
this Stackoverflow article about links extraction 中的建议是使用 BeatifulSoup。如果没有其他选择,我会的。 BeatifulSoup 将是另一个依赖项,因为我使用基于 lxml 的版本。
我的问题:
- 有没有一种方法可以从我使用的 Python 可读性版本中获取纯文本,而无需分叉代码?
- 有没有一种方法可以轻松地从 Python 可读性的 HTML 结果中检索纯文本,例如通过使用 lxml、BeatifulSoap、RegEx 或其他东西
- 如果上面的答案是否定的,或者是但不容易,修改 Python 可读性的方法是什么。这种修改是否足以(对足够多的人)使这种扩展正式化?
【问题讨论】:
-
你的意思是去掉html标签,只得到文本? stackoverflow.com/questions/753052/…
-
最好有这样的工具。我认为有一个好的工具可以开发。希望你会开始努力。
-
对,我的意思是只有文字。我想在第一段或第二段中对指向页面的链接进行注释,以便该人可以做出更明智的决定是否访问该链接。
标签: python readability text-extraction html-content-extraction