【发布时间】:2019-11-30 23:40:46
【问题描述】:
我实际上是在尝试获取此网页中包含的游戏信息:https://www.humblebundle.com/store/search?sort=discount&filter=onsale
我尝试的第一件事是复制几天前一位用户为帮助我解决类似问题所做的事情,发出 POST 请求以直接访问我需要的网络数据的来源。 Here's the link of that question in case you still don't know what I'm trying to achieve。
为此,我首先执行此代码以获取未加载元素的 Web 的 HTML 文件:
import requests
req = requests.get("https://www.humblebundle.com/store/search?sort=discount&filter=onsale")
a = open("humble.txt", "w")
a.write(req.text)
a.close()
它返回给我this code。
您可以在 1084 行中注意到一个名为“storefront-constants-json-data”的脚本,它引起了我的注意,因为它具有与页面相关的一些变量是唯一的。然后我想,“嘿,一定有更多关于这个脚本的信息”。我在网络上单击“检查元素”并转到“网络”选项卡。我在每个 JS 文件中搜索了该脚本名称,发现只有一个引用,this one。
此时我迷路了,事实上,我什至不知道我是否以正确的方式(因为我不知道任何 JavaScript)。有人可以告诉我获得那些 Humble Bundle 游戏的路径吗?。
Pd:我昨天写了一个类似的问题,但它非常模糊,所以我决定重写它,提供我拥有的所有信息并解释我尝试过的内容。
Pd2:我不想用 Selenium 或类似的模块来做,它们太慢了。
【问题讨论】:
标签: python-3.x web-scraping python-requests