【发布时间】:2010-07-24 16:15:53
【问题描述】:
主要任务:我正在尝试获取网页的几行摘要。即我想要一个函数,它接受一个 URL 并从该页面返回信息最丰富的段落。 (这通常是实际内容文本的第一段,与导航栏等“垃圾文本”形成对比。)
所以我设法通过删除标签、扔掉<HEAD> 和所有脚本来将HTML 页面缩减为一堆文本。但有些文字仍然是“垃圾文字”。我想知道实际的文本段落从哪里开始。 (理想情况下,它应该与人类语言无关,但如果您只有英语的解决方案,那也可能会有所帮助。)
如何判断哪些文本是“垃圾文本”,哪些是实际内容?
更新:我看到有人让我使用 HTML 解析库。我正在使用美丽的汤。我的问题不是解析 HTML;我已经摆脱了所有的 HTML 标签,我只有一堆文本,我想将上下文文本与垃圾文本分开。
【问题讨论】:
-
你能贴出你所拥有的文本样本吗?你希望它变成什么?关于使用正则表达式解析 HTML - 强制链接 - stackoverflow.com/questions/1732348/…
-
这是来自网页的文本示例:cool-rr.com/sample_text.delete_me.txt 它恰好是 Python 文档中的一个页面。
-
我删除了
[regex]标签,因为它似乎在诱使人们认为您正在尝试使用正则表达式从页面中提取文本,但这不是您的问题所在全部。这确实是一个文本处理问题。它与 HTML 几乎没有任何关系。文本是从网页中提取的这一事实并不重要,除非您想尝试使用 HTML 标记来帮助您识别重要的文本片段。
标签: python html text screen-scraping