【问题标题】:Best Open Source Spider for Site Coverage网站覆盖的最佳开源蜘蛛
【发布时间】:2010-01-13 07:19:56
【问题描述】:

我对抓取很多网站很感兴趣。最重要的考虑是蜘蛛能够到达尽可能多的站点。大多数蜘蛛缺乏的一个关键特性是执行 JavaScript 的能力。这是抓取 ajax 驱动的网站所必需的。我真的很喜欢开源,我需要为我的项目修改代码。

目前我认为 Lucine 中的 Solr 是一个非常好的解决方案。 http://lucene.apache.org/solr/features.html

有人用过 Solr 或 Lucine 吗?我对 Solr 的最大问题是无法执行 javascript,但是它具有丰富的功能集和可扩展性,这两者都使 Solr 具有吸引力。

【问题讨论】:

    标签: javascript web-crawler


    【解决方案1】:

    Solr 不是爬虫,而是搜索引擎(搜索索引以返回结果)。

    也就是说,我真的很喜欢 heritrix 的灵活性。大多数爬虫不会执行 Javascript(但有些爬虫会尝试从中提取链接),因为即使在今天也没有多大意义。问题是 Heritrix 将允许您插入自己的类,以便对抓取的数据做任何您想做的事情。

    【讨论】:

    • Heritrix 非常棒,它具有我正在寻找的功能:ExtractorJS、ExtractorSWF、ExtractorCSS、ExtractorPDF 等等!你对 Javascript 的看法再正确不过了,因为它是现代蜘蛛的重要组成部分。 Google 和其他主要搜索引擎评估 javascript。
    • 你真的是说他们执行页面中的所有javascript?一件事是提取PDF,JS等中的链接,但我不会称之为评估JS,PDF等。
    【解决方案2】:

    【讨论】:

      【解决方案3】:

      Solr 是建立在 Lucene 之上的搜索引擎。它对爬行没有任何作用。看看Apache Nutch。破解 javascript 可能是个问题,因为它们通常会导致爬虫进入死胡同。

      【讨论】:

      • 不好意思,Lucine 有很多子项目。
      【解决方案4】:

      watir 可能对你有用。

      【讨论】:

      • Watir 很糟糕,它不太符合我的需求,但我必须牢记这一点。
      【解决方案5】:

      对于基于 javascript 模板创建 dom 的页面,您真的希望在您的蜘蛛程序中执行完整的 javascript。查看 Node JS 的 https://github.com/mikeal/spider

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2023-02-16
        • 2011-01-24
        • 2017-09-11
        相关资源
        最近更新 更多