【问题标题】:what is the logic for a web crawler to click on specific elements on the webpage网络爬虫点击网页上特定元素的逻辑是什么
【发布时间】:2013-11-09 09:35:53
【问题描述】:

我编写了一个爬虫应用程序,它打开给定的网页并获取 HTTP 请求并存储到 Excel 表中。

现在,我已经使用 jQueries 为一些按钮绑定了单击事件(或者您可以考虑按钮的 onClick 事件)。现在可能是什么逻辑,让我的爬虫点击这些按钮并获取 HTTP 请求并执行与我之前所说的相同的事情。

那么简单来说,如何让我的爬虫点击按钮?

【问题讨论】:

  • 我不认为这是一件简单的事情。为此,您的爬虫必须能够理解和执行 javascript。我认为你需要一个无头浏览器来支持phantomjs.org
  • 除非按钮是简单的超链接。我实际上对“...获取 HTTP 请求...”的措辞有点困惑——不知道从中理解什么
  • @Alexander :举个例子,我使用爬虫打开了 stackoverflow.com,我得到了像 google-analytics.com/ga.js 这样的 HTTP 请求,当浏览器呈现网页时,将加载 #n 个元素.所以我的爬虫拿了这个(来自 Fiddler 调试器)并推送到 excel 表。我的问题是加载东西,我的爬虫可以做,但是我应该如何让我的爬虫点击特定的链接?
  • @KhanhTO 感谢您的建议,请给我一个例子

标签: c# javascript jquery .net web-crawler


【解决方案1】:
  1. 首先,您必须制作一个可以理解和解析 javascript 的爬虫。
  2. 即使你能做到,这取决于你是否能够获得链接的点击功能/OnClick的实现 从中。 例如通过document.location给出的链接可以理解,但是如果生成链接就很难理解了 通过 ajax 调用。

这是网站上的 SEO 内容不通过 javascript 加载的主要原因

【讨论】:

  • 感谢您的回复。是的,这正是我的问题。我希望我的爬虫进入网站和产品页面,然后将产品添加到购物车,即单击“添加购物车”按钮。如何让我的产品点击加入购物车?
猜你喜欢
  • 2010-09-26
  • 1970-01-01
  • 1970-01-01
  • 2010-11-23
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多