【发布时间】:2015-04-25 00:32:18
【问题描述】:
我正在尝试抓取http://www.carwale.com/used/cars-in-mumbai/ 前 20 辆汽车及其数据是 html 格式,很容易被抓取。 我被困在 21 岁以上的汽车上——它们是 JSON。每增加 20 辆汽车的新页面的 URL 格式为“http://www.carwale.com/webapi/classified/stockfilters/?city=1&kms=0-&year=0-&budget=0-&pn=2”,pn 不断增加。
我试过了:
i = 2
while i in range(totalcars/20+1):
link = 'http://www.carwale.com/webapi/classified/stockfilters/?city=2&kms=0-&year=0-&budget=0-&pn='+str(i)
response = urllib2.urlopen(link)
data = json.load(response)
print data
i += 1
“HTTPError: HTTP Error 400: Bad Request”是响应
手动尝试此链接会返回“缺少平台源”
“http://www.carwale.com/webapi/”返回“403 - 禁止访问:访问被拒绝。”
访问这些数据最pythonic和最有效的方法是什么?
【问题讨论】:
-
你的网址不正确
-
该 url 正是我通过单击上图中文件的新选项卡中打开获得的,过去在 json 上有效
-
你的权利,但由于某种原因它缺少一些参数。我会查看
$.GetNextPageData()函数,看看它们是否隐藏在你的 cookie 中,它们用于验证你的请求。 -
这是 Java 包的一部分,对吗?如果是这样,我很遗憾没有任何 Java 经验。
-
那应该在他们的 javascript/Jquery 中
标签: python json python-2.7 web-scraping