【发布时间】:2016-05-19 19:33:29
【问题描述】:
我正在尝试在 Apache Nutch 中构建一个爬虫和抓取工具,以查找包含讨论特定单词主题(例如“选举”、“选举”、“投票”等)的部分的所有页面。
一旦我爬过,Nutch 会从停用词和标签中清除 HTML,但它不会删除菜单声音(在网站的每个页面中)。 因此,当您查找所有谈论选举的页面时,您可能会检索到整个网站,因为它的菜单中包含“选举”一词,因此在每个页面中都有。
我想知道是否存在分析网站的多个页面以了解页面的主要模板是什么的技术。有用的论文和/或实现/库。
我正在考虑创建某种 hadoop 作业来分析多个页面之间的相似性以提取模板。但是同一个网站可能有多个模板,所以很难想出一个有效的方法来做到这一点。
例如
WEB页面1:
MENU HOME VOTE ELECTION NEWS
meaningful text... elections ....
网页 2:
MENU HOME VOTE ELECTION NEWS
meaningful text... talking about swimming pools ....
【问题讨论】:
标签: html hadoop mapreduce web-scraping nutch