【发布时间】:2015-01-17 12:35:50
【问题描述】:
我正在使用 mechanize gem 来抓取具有登录身份验证的网站内容。我可以使用 mechanize gem 成功登录,但是在使用 mechanize 提交表单后,服务器响应只有 javascript 内容,我在响应页面中看到的只是 javascript 内容我没有找到任何 html 数据,我不确定是什么我做错了。这是我的代码,请看一下
agent = Mechanize.new { |a|
a.follow_meta_refresh = true
}
agent.get("https://www.somewebsite.com/signin.html")
form = agent.page.forms.first
form.username = 'username@mail.com'
form.password = 'password'
page = form.submit
puts page.body ## returns javascript content only
但原始网站有我想要的仪表板内容。
谁能帮帮我,提前谢谢。
【问题讨论】:
-
您确定您正在查看的网站没有构建 html 客户端吗?
-
它的网站很大,我通过 mechanize 发送的 url 上有很多内容
-
能否请您帮助如何通过 mechanize gem 或 ruby 中的任何内容了解网站是否对内容抓取有限制
-
在网站上,view the page source。
-
@PrakashMurthy 如何在 ruby 中以编程方式了解它或如何在页面源代码中了解它?
标签: ruby-on-rails ruby web-scraping nokogiri mechanize