【发布时间】:2012-02-21 16:48:13
【问题描述】:
我正在尝试重现 Clearly 完成的网页“内容检测”。
给定一个网页,我想自动区分文本内容,而不是文本菜单、文本广告、文本按钮等。
哪些算法适合检测 HTML 页面中的文本内容?
[在 StackOverflow 的情况下,内容将是实际问题。其余的只是“内容的绒毛”。]
【问题讨论】:
标签: algorithm text open-source detection
我正在尝试重现 Clearly 完成的网页“内容检测”。
给定一个网页,我想自动区分文本内容,而不是文本菜单、文本广告、文本按钮等。
哪些算法适合检测 HTML 页面中的文本内容?
[在 StackOverflow 的情况下,内容将是实际问题。其余的只是“内容的绒毛”。]
【问题讨论】:
标签: algorithm text open-source detection
您可能想看看 Readability 的算法。
What algorithm does Readability use for extracting text from URLs?
【讨论】: