【发布时间】:2013-12-31 15:48:34
【问题描述】:
我正在尝试让 scrapy 解析页面上的链接以进行抓取。不幸的是,此页面上的链接包含在 JavaScript onclick 函数中。如果可能,我想使用 SgmlLinkExtractor 规则来提取链接以解析 JavaScript 并创建与 callback='parse_item' 一起使用的 URL。
这里是每个链接与 JS 函数的示例:
<a onclick="window.open('page.asp?ProductID=3679','productwin','width=700,height=475,scrollbars,resizable,status');" href="#internalpagelink">Link Text</a>
我只需要将链接提取器发送到回调 parse_item: http://domain.com/page.asp?ProductID=3679
我将如何编写 CrawlSpider 规则来做到这一点?
如果这是不可能的,那么最终能够解析在一组定义的起始页面上以这种 JavaScript 链接格式嵌入的所有页面的最佳方法是什么?
谢谢大家。
【问题讨论】:
-
获取onclick属性,解析即可。
-
是的,正如问题所说如何我将编写 CrawlSpider 规则来做到这一点?提取 onClick 函数的 page.asp?ProductID=3679 部分并将其作为 URL 返回的规则是什么样的?
标签: javascript python web-scraping scrapy