【问题标题】:ruby mechanize website scraping always returns javascript data onlyruby mechanize 网站抓取始终只返回 javascript 数据
【发布时间】:2015-01-17 12:35:50
【问题描述】:

我正在使用 mechanize gem 来抓取具有登录身份验证的网站内容。我可以使用 mechanize gem 成功登录,但是在使用 mechanize 提交表单后,服务器响应只有 javascript 内容,我在响应页面中看到的只是 javascript 内容我没有找到任何 html 数据,我不确定是什么我做错了。这是我的代码,请看一下

agent = Mechanize.new { |a|
 a.follow_meta_refresh = true
}

agent.get("https://www.somewebsite.com/signin.html")

form = agent.page.forms.first
form.username = 'username@mail.com'
form.password = 'password'
page = form.submit

puts page.body ## returns javascript content only

但原始网站有我想要的仪表板内容。

谁能帮帮我,提前谢谢。

【问题讨论】:

  • 您确定您正在查看的网站没有构建 html 客户端吗?
  • 它的网站很大,我通过 mechanize 发送的 url 上有很多内容
  • 能否请您帮助如何通过 mechanize gem 或 ruby​​ 中的任何内容了解网站是否对内容抓取有限制
  • 在网站上,view the page source
  • @PrakashMurthy 如何在 ruby​​ 中以编程方式了解它或如何在页面源代码中了解它?

标签: ruby-on-rails ruby web-scraping nokogiri mechanize


【解决方案1】:

我使用 capybara-webkit 来解决我的问题

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-11-05
    • 1970-01-01
    • 1970-01-01
    • 2014-04-07
    相关资源
    最近更新 更多