【问题标题】:Unable to scrape amazon orders page无法抓取亚马逊订单页面
【发布时间】:2020-12-30 15:12:42
【问题描述】:

我目前正在制作一个项目,它将获取我在亚马逊上订购的所有订单并对它们进行分类,然后将它们写入 Excel 文件。问题是,当我尝试使用bs4 抓取页面时,我得到的结果为None

我之前做过一个类似的项目,它将在亚马逊上搜索您要搜索的产品,然后将有关该产品的所有数据(例如 namepricereview)保存在 json 文件中。 效果很好。

但这似乎不起作用

这里是代码 -

    'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.102 Safari/537.36'
}

link = 'https://www.amazon.in/gp/your-account/order-history?opt=ab&digitalOrders=1&unifiedOrders=1&returnTo=&orderFilter=year-2020'

data = requests.get(link, headers = headers)

soup = BeautifulSoup(data.text, 'lxml')

product = soup.find('div', class_="a-box-group a-spacing-base order")

print(product)

我是初学者,但我认为这是因为我需要登录才能获取我的详细信息,但我的密码已经保存在我的浏览器中。

感谢任何帮助。 谢谢

【问题讨论】:

  • 我不认为亚马逊会让每个人在没有身份验证的情况下抓取任何页面。我相信这些案例有一个官方 API
  • 您不能指望在运行 python 脚本时使用存储在浏览器中的凭据。您需要为此使用 selenium 之类的东西,即使启用了 2-FA,也很难工作。

标签: python web-scraping beautifulsoup python-requests


【解决方案1】:

参考thisGitHub项目

亚马逊与大多数知名公司一样,不允许简单的抓取,需要某种形式的身份验证。

【讨论】:

  • 谢谢,但它看起来像是为卖家而不是客户制作的,你确定吗?你以前用过吗?
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-06-29
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多