【发布时间】:2014-10-12 10:00:58
【问题描述】:
我前段时间偶然发现了pyexecjs,我想知道它是否可以与scrapy一起使用来抓取JS生成的数据。 https://github.com/doloopwhile/PyExecJS
我查看了应该如何使用该库的示例,但我不确定如何将它与 scrapy 集成。
【问题讨论】:
标签: javascript python web-scraping scrapy screen-scraping
我前段时间偶然发现了pyexecjs,我想知道它是否可以与scrapy一起使用来抓取JS生成的数据。 https://github.com/doloopwhile/PyExecJS
我查看了应该如何使用该库的示例,但我不确定如何将它与 scrapy 集成。
【问题讨论】:
标签: javascript python web-scraping scrapy screen-scraping
我强烈建议您使用 PhantomJS 尝试 Selenium。这是一个示例代码。
from selenium import webdriver
url = "http://www.taobao.com/"
browser = webdriver.PhantomJS()
browser.get(url)
input = browser.find_element_by_xpath("//input[@id='q']")
bnt = browser.find_element_by_xpath("//button[@class='btn-search']")
input.send_keys("watch")
bnt.submit()
更多API信息请参考WebDriver API 至于如何将 selenium 与 scrapy 集成,我的建议是将它嵌入到你的蜘蛛的解析函数中。例如:
【讨论】: