【发布时间】:2020-12-30 15:12:42
【问题描述】:
我目前正在制作一个项目,它将获取我在亚马逊上订购的所有订单并对它们进行分类,然后将它们写入 Excel 文件。问题是,当我尝试使用bs4 抓取页面时,我得到的结果为None。
我之前做过一个类似的项目,它将在亚马逊上搜索您要搜索的产品,然后将有关该产品的所有数据(例如 name、price、review)保存在 json 文件中。
效果很好。
但这似乎不起作用
这里是代码 -
'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.102 Safari/537.36'
}
link = 'https://www.amazon.in/gp/your-account/order-history?opt=ab&digitalOrders=1&unifiedOrders=1&returnTo=&orderFilter=year-2020'
data = requests.get(link, headers = headers)
soup = BeautifulSoup(data.text, 'lxml')
product = soup.find('div', class_="a-box-group a-spacing-base order")
print(product)
我是初学者,但我认为这是因为我需要登录才能获取我的详细信息,但我的密码已经保存在我的浏览器中。
感谢任何帮助。 谢谢
【问题讨论】:
-
我不认为亚马逊会让每个人在没有身份验证的情况下抓取任何页面。我相信这些案例有一个官方 API
-
您不能指望在运行 python 脚本时使用存储在浏览器中的凭据。您需要为此使用 selenium 之类的东西,即使启用了 2-FA,也很难工作。
标签: python web-scraping beautifulsoup python-requests