【发布时间】:2022-01-04 21:23:58
【问题描述】:
我在尝试网络报废此webpage(目标)时遇到了一些问题。我总是得到这个webpage(主要)的内容。实际上,当URL_target 加载时,在0.5 秒内,会显示URL_main 的内容,然后显示“真实”的URL_target 内容。我想这就是为什么我在网络抓取 URL_target 时无法获得最终内容的原因。
import requests
from bs4 import BeautifulSoup
url_main = "https://www.lequipe.fr/Football/match-direct/ligue-1/2020-2021/ol-dijon-live/477168"
url_target = url_main + "#face-a-face"
soup_main = BeautifulSoup(requests.get(url_main, verify=False).content, "html.parser")
soup_target = BeautifulSoup(requests.get(url_target, verify=False).content, "html.parser")
print(soup_main == soup_target)
返回True。
有人知道我如何获得 url_target 的“真实”内容吗?谢谢!
【问题讨论】:
-
Fragment/hash 不会被发送到服务器或者只是被它忽略。而且你不能像那样获得动态加载的内容。
-
@gre_gor 是的,这家伙也有同样的问题。但他得到的答案并不是很笼统。我不知道在哪里可以找到我应该请求的这个神秘 URL...
-
@RillettesBoy,你实际上想从那里提取什么数据?
-
页面上的所有内容。例如,“confrontations depuis 2011”部分中的所有内容:“6, 2 nuls, 2”......以及以下所有部分。
标签: python python-3.x web-scraping beautifulsoup python-requests