【发布时间】:2013-09-19 14:09:03
【问题描述】:
我正在尝试从这个网站上抓取http://saintbarnabas.hodesiq.com/joblist.asp?user_id= 我想获取所有的 RN... 我可以抓取数据但无法继续到下一页 因为它的javascript。我尝试阅读其他问题,但我不明白。这是我的代码
class MySpider(CrawlSpider):
name = "commu"
allowed_domains = ["saintbarnabas.hodesiq.com"]
start_urls = ["http://saintbarnabas.hodesiq.com/joblist.asp?user_id=",
]
rules = (Rule (SgmlLinkExtractor(allow=('\d+'),restrict_xpaths=('*'))
, callback="parse_items", follow= True),
)
下一个按钮显示为
<a href="Javascript: Move('next')">Next</a>
这个分页让我死了......
【问题讨论】:
-
如果你需要抓取 JavaScript 或 AJAX 内容,你可以通过 Selenium WebDriver 和 Firefox 来阅读它,它会打开一个成熟的浏览器来阅读页面。
-
怎么样?你能给我一个想法,以便它可以指向另一个页面...
标签: python selenium-webdriver web-scraping scrapy