【问题标题】:Bot Web Quality机器人网络质量
【发布时间】:2013-11-15 05:33:11
【问题描述】:

我正在寻找一个好的开源机器人来确定某些质量,这通常是谷歌索引所必需的。

例如

  • 查找重复的标题
  • 无效链接(jspider 会这样做,我想更多的人会这样做)
  • 完全相同的页面,但不同的网址
  • 等,其中等等于谷歌质量要求。

【问题讨论】:

  • 这个问题真的很不具体。蜘蛛在找到重复的标题时应该做什么?还是无效链接?还是完全相同的页面?和“等,其中等等于谷歌质量要求。”没有说明您的要求是什么。你能详细说明你的实际要求是什么吗?你想用这个蜘蛛做什么?
  • 另外,您是要查看很多网站,还是只查看您自己维护的一个?
  • 是的,我知道,这就是为什么我认为像 scrapy 这样的框架更适合 beeter。它用于我维护的网页......但它们很多!

标签: web-crawler googlebot


【解决方案1】:

您的要求非常具体,因此不太可能有完全符合您要求的开源产品。

但是,有许多用于构建网络爬虫的开源框架。您使用哪一种取决于您的语言偏好。

例如:

通常,这些框架会根据您提供的规则提供用于抓取和抓取网站页面的类,但随后您可以通过挂钩自己的代码来提取所需的数据。

【讨论】:

  • 我对一些hand me bot 进行了讨论,我用scrapy 做了一些......我认为这是目前最好的答案!你知道任何已经为这样的东西制作的机器人吗?
【解决方案2】:

Google Webmaster Tools 是一种基于 Web 的服务(而不是按需机器人),它并不能满足您的所有要求 - 但它确实可以满足您的要求,并且很多你没有要求的东西,而且 - 来自谷歌 - 它无疑符合你奇怪的“等等,其中 etc 等于谷歌质量要求。” 比其他任何地方都好。

【讨论】:

  • 是的,我知道,我的问题受到网站管理员工具的启发……但我想避免这种情况。我的网页有很多页面,而且都是动态的,所以很难找到重复的标题,我想这样做,因为谷歌会发现!
猜你喜欢
  • 1970-01-01
  • 2011-04-20
  • 1970-01-01
  • 2011-01-20
  • 2010-11-05
  • 2017-11-07
  • 2023-01-08
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多