【发布时间】:2016-09-06 03:46:22
【问题描述】:
我只想知道当网站向我发送 json 响应而不是 html 时如何制定规则?在开始 url 第一个响应中,它给了我一个 html 响应,但是当我浏览页面时,它给了我 json 响应。这是我的规则:
Rule(SgmlLinkExtractor(restrict_xpaths=('//div[@class="GridTimeline-items"]'), tags=('div'),
attrs=('data-min-position'), allow=(r''), process_value=my_process_value_friends),
callback='parse_friends', follow=True),
我的问题是,如何将 xpath 应用于 json 响应?
谢谢,
【问题讨论】:
-
您应该使用
scrapy.linkextractors.Linkextractor,因为SgmlLinkExtractor已经被弃用了一段时间。不过,这两者本质上是一回事。
标签: python json scrapy web-crawler sgml