【问题标题】:Crawling sub-domain with Anemone使用 Anemone 爬行子域
【发布时间】:2012-02-15 07:16:40
【问题描述】:

我正在使用海葵。我如何也抓取子域?例如,如果我有网站www.abc.com,我的爬虫也应该爬取support.abc.comblah.abc.com。我正在使用 Ruby 1.8.7 和 Rails 3。

【问题讨论】:

  • 为什么这是一个 Rails 或 Nokogiri 问题?
  • 我删除了 rails 和 nokogiri 标签:它们不是这个问题的核心。

标签: ruby web-crawler anemone


【解决方案1】:

这是 Github 上的一个提交,可以解决您的问题。

https://github.com/runa/anemone/commit/91559bde052956cfc40ae62678ec2a61574cf928

根据链接更改您的海葵 gem 文件。

【讨论】:

    【解决方案2】:

    根据Anemone docs,您可以将多个站点传递给crawl 命令:

    Anemone.crawl("http://www.abc.com/", "http://support.abc.com/", "http://blah.abc.com/")
    

    当然,您的下一个问题可能是 ABC 禁止您抓取他们的网站,但这是一个不同的问题。

    【讨论】:

    • 不知道子域怎么办?
    • 如果您不知道子域,您将不得不尝试通过搜索从第一页检索到的链接来定位它们,寻找属于子域的其他站点,或者看起来是兄弟域,起始一个。然后产生二次爬网。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-01-04
    相关资源
    最近更新 更多