【问题标题】:Using Search Engine APIs to replace my own crawling (for non search engine purposes)?使用搜索引擎 API 替换我自己的抓取(用于非搜索引擎目的)?
【发布时间】:2013-09-12 13:16:40
【问题描述】:

目前,我正在抓取大量预定义的网站,寻找极少数感兴趣的特定文档。重要的是,我不会抓取这些网站来创建自己的搜索引擎:它专门用于检索文档。

所有主要的搜索引擎都有一个我不介意付费的 API,但他们似乎专注于使用他们的 API 来制作您自己的搜索引擎。

例如:http://info.yahoo.com/legal/us/yahoo/boss/tou/ 的 Yahoo BOSS TOS。 B.1(a) 规定“您只能将服务用于合并和显示服务的结果,作为部署在您的产品上的搜索产品的一部分”。所以我只能将它用于我自己的搜索引擎。

Google 只有自定义搜索引擎的东西,这又不是我需要的。

Bing 的 API 似乎更接近我的需要,但它的 TOS 要求不删除某些信息等。但话又说回来,它并不要求我只使用它来实现我自己的搜索引擎(从我可以看到)。

我是否对此阅读过多,或者是否有一个搜索引擎允许我基本上使用他们对某些网站的抓取结果而不是我自己的搜索结果用于我的产品?同样,搜索结果本身不是我的产品:它是我对文档中的数据所做的。

感谢任何提示。

【问题讨论】:

    标签: search yahoo-api bing-api google-search-api


    【解决方案1】:

    您不会希望使用搜索引擎来执行此操作。

    搜索引擎不会索引网站上的所有内容。例如,如果一个站点有很多类似的页面,它们将被丢弃。具有大量页面的站点将不会被完全索引。

    这样你可能会错过很多页面。

    让它爬行!

    附言 爬取个别网站经常违反他们的服务条款。如果您关心这一点,请注意遵守 robots.txt。

    【讨论】:

    • 感谢拜伦的回复。 FWIW,我们绝对遵守 robots.txt,并且我们做了很多工作来降低我们点击的网站的负载(我们可以非常缓慢地进行,因为我们有很多网站要并行抓取)。我们要提取的文档非常少且相距甚远,当它们存在时,它们不会被搜索引擎丢弃(因为它们没有相似的版本……这只是文档本身的性质)。正如我所说,谢谢,但我想我仍然需要知道是否有人知道我们是否可以做我们想做的事。
    猜你喜欢
    • 2014-02-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-06-13
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多