【发布时间】:2023-03-20 19:45:01
【问题描述】:
我正在寻找一种方法来从包含大量链接(可能还有文本)的网页中提取用于导航的菜单。我感兴趣的页面是非常简单、有效的 XHTML,并且可以安全地假设菜单位于页面的开头或结尾。但是到目前为止,我还没有找到一种很好的通用方法来找到它的确切位置 - 我希望你能在这方面帮助我。
快速说明:我不是在寻找诸如可读性之类的东西 - 找到主要文章并删除其他所有内容,而是寻找专门找到菜单的东西。 此外,“找到一个有很多链接作为继任者的元素”这种幼稚的方法也不能很好地工作——因为我的页面往往包含很长的链接列表。
编辑:我需要菜单来获取其中链接的页面的内容(我为信息提取项目构建了一个网络抓取工具)。 我使用的一些示例页面:
- http://p2.cs.berkeley.edu/
- http://www.cs.cornell.edu/bigreddata/maybms/(注意:这里我需要指向出版物/下载的菜单而不是侧边栏导航,但使用 Readability 之类的东西更容易摆脱侧边栏导航)。
【问题讨论】:
-
你能给个页面样本吗?
-
1。你想用菜单做什么? 2。我们可以看到页面吗?否则无法为您提供帮助。
-
关于示例页面 - 我已经添加了一些,但主要问题是我正在寻找一个尽可能少页面特定的解决方案。
标签: data-mining text-mining information-extraction web-scraping