【问题标题】:Crawling a Javascript heavy site with Ruby使用 Ruby 抓取 Javascript 繁重的网站
【发布时间】:2013-11-23 22:38:09
【问题描述】:

我想抓取/抓取大量严重依赖 Javascript 的网站,而我的 Mechanize 代理(我通常使用的代理)无法处理这些网站,因为它无法呈现 html。一个很好的例子是this site

有什么方法可以从 Ruby on Rails 应用程序中获取该站点的渲染 html 输出?

我正在使用 Ruby 2.0.0 和 Rails 4.0.1

【问题讨论】:

  • 也许看看phantomjs.org
  • 您的选择是弄清楚如何做或切换到像 selenium 这样的完整浏览器解决方案。

标签: javascript ruby-on-rails ruby web-crawler mechanize


【解决方案1】:

您可以使用Capybara 来执行此操作。这是一个资源:

或在 Google 上搜索“Capybara”刮刀。

有一点需要注意,性能会很糟糕。我造了这么一个刮刀,几乎不值得。

【讨论】:

  • 感谢您的提示。我要研究这种解决方案。
【解决方案2】:

您可以使用 I-Macros 进行网页抓取。您提到的网站使用框架。所以每一帧都可以被视为单独的页面并被抓取。作为替代方案,您可以使用 使用 apache HttpClient/HtmlUnit 的简单 java 程序 API。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-04-07
    • 2015-09-14
    • 1970-01-01
    • 2011-03-22
    • 1970-01-01
    • 2012-03-09
    • 1970-01-01
    相关资源
    最近更新 更多