【问题标题】:Scraping API - "Platform source was missing"抓取 API - “平台源丢失”
【发布时间】:2015-04-25 00:32:18
【问题描述】:

我正在尝试抓取http://www.carwale.com/used/cars-in-mumbai/ 前 20 辆汽车及其数据是 html 格式,很容易被抓取。 我被困在 21 岁以上的汽车上——它们是 JSON。每增加 20 辆汽车的新页面的 URL 格式为“http://www.carwale.com/webapi/classified/stockfilters/?city=1&kms=0-&year=0-&budget=0-&pn=2”,pn 不断增加。

我试过了:

i = 2  
while i in range(totalcars/20+1):
    link = 'http://www.carwale.com/webapi/classified/stockfilters/?city=2&kms=0-&year=0-&budget=0-&pn='+str(i)
    response = urllib2.urlopen(link)
    data = json.load(response)   
    print data
    i += 1  

“HTTPError: HTTP Error 400: Bad Request”是响应

手动尝试此链接会返回“缺少平台源”

http://www.carwale.com/webapi/”返回“403 - 禁止访问:访问被拒绝。”

访问这些数据最pythonic和最有效的方法是什么?

【问题讨论】:

  • 你的网址不正确
  • 该 url 正是我通过单击上图中文件的新选项卡中打开获得的,过去在 json 上有效
  • 你的权利,但由于某种原因它缺少一些参数。我会查看 $.GetNextPageData() 函数,看看它们是否隐藏在你的 cookie 中,它们用于验证你的请求。
  • 这是 Java 包的一部分,对吗?如果是这样,我很遗憾没有任何 Java 经验。
  • 那应该在他们的 javascript/Jquery 中

标签: python json python-2.7 web-scraping


【解决方案1】:

你必须添加这个标题,它对我有用。

{"sourceid":"1"}

【讨论】:

    猜你喜欢
    • 2020-12-11
    • 1970-01-01
    • 2023-04-09
    • 1970-01-01
    • 2018-09-16
    • 2019-08-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多