【发布时间】:2011-04-27 12:48:00
【问题描述】:
我想解析一个 html 页面并从中提取有意义的文本。任何人都知道一些好的算法来做到这一点?
我在 Rails 上开发我的应用程序,但我认为 ruby 在这方面有点慢,所以我认为如果在 c 中存在一些好的库,那将是合适的。
谢谢!!
PD:请不要用 java 推荐任何东西
更新: 我找到了这个link text
不幸的是,在 python 中
【问题讨论】:
-
要求文本有意义使这项任务变得更加困难。
-
是的,但显然“统计”方法是正确的答案
-
那可能学点 Python 吧? :-)
标签: html c ruby html-parsing html-content-extraction