【发布时间】:2013-11-15 05:33:11
【问题描述】:
我正在寻找一个好的开源机器人来确定某些质量,这通常是谷歌索引所必需的。
例如
- 查找重复的标题
- 无效链接(jspider 会这样做,我想更多的人会这样做)
- 完全相同的页面,但不同的网址
- 等,其中等等于谷歌质量要求。
【问题讨论】:
-
这个问题真的很不具体。蜘蛛在找到重复的标题时应该做什么?还是无效链接?还是完全相同的页面?和“等,其中等等于谷歌质量要求。”没有说明您的要求是什么。你能详细说明你的实际要求是什么吗?你想用这个蜘蛛做什么?
-
另外,您是要查看很多网站,还是只查看您自己维护的一个?
-
是的,我知道,这就是为什么我认为像 scrapy 这样的框架更适合 beeter。它用于我维护的网页......但它们很多!
标签: web-crawler googlebot