【发布时间】:2013-11-09 09:35:53
【问题描述】:
我编写了一个爬虫应用程序,它打开给定的网页并获取 HTTP 请求并存储到 Excel 表中。
现在,我已经使用 jQueries 为一些按钮绑定了单击事件(或者您可以考虑按钮的 onClick 事件)。现在可能是什么逻辑,让我的爬虫点击这些按钮并获取 HTTP 请求并执行与我之前所说的相同的事情。
那么简单来说,如何让我的爬虫点击按钮?
【问题讨论】:
-
我不认为这是一件简单的事情。为此,您的爬虫必须能够理解和执行 javascript。我认为你需要一个无头浏览器来支持phantomjs.org
-
除非按钮是简单的超链接。我实际上对“...获取 HTTP 请求...”的措辞有点困惑——不知道从中理解什么
-
@Alexander :举个例子,我使用爬虫打开了 stackoverflow.com,我得到了像 google-analytics.com/ga.js 这样的 HTTP 请求,当浏览器呈现网页时,将加载 #n 个元素.所以我的爬虫拿了这个(来自 Fiddler 调试器)并推送到 excel 表。我的问题是加载东西,我的爬虫可以做,但是我应该如何让我的爬虫点击特定的链接?
-
@KhanhTO 感谢您的建议,请给我一个例子
标签: c# javascript jquery .net web-crawler