【问题标题】:requests.get(url) returns the content of another webpagerequests.get(url) 返回另一个网页的内容
【发布时间】:2022-01-04 21:23:58
【问题描述】:

我在尝试网络报废此webpage(目标)时遇到了一些问题。我总是得到这个webpage(主要)的内容。实际上,当URL_target 加载时,在0.5 秒内,会显示URL_main 的内容,然后显示“真实”的URL_target 内容。我想这就是为什么我在网络抓取 URL_target 时无法获得最终内容的原因。

import requests
from bs4 import BeautifulSoup
url_main = "https://www.lequipe.fr/Football/match-direct/ligue-1/2020-2021/ol-dijon-live/477168"
url_target = url_main + "#face-a-face"
soup_main = BeautifulSoup(requests.get(url_main, verify=False).content, "html.parser")
soup_target = BeautifulSoup(requests.get(url_target, verify=False).content, "html.parser")
print(soup_main == soup_target)

返回True

有人知道我如何获得 url_target 的“真实”内容吗?谢谢!

【问题讨论】:

  • Fragment/hash 不会被发送到服务器或者只是被它忽略。而且你不能像那样获得动态加载的内容。
  • @gre_gor 是的,这家伙也有同样的问题。但他得到的答案并不是很笼统。我不知道在哪里可以找到我应该请求的这个神秘 URL...
  • @RillettesBoy,你实际上想从那里提取什么数据?
  • 页面上的所有内容。例如,“confrontations depuis 2011”部分中的所有内容:“6, 2 nuls, 2”......以及以下所有部分。

标签: python python-3.x web-scraping beautifulsoup python-requests


【解决方案1】:

我真的不知道如何解决您的问题,但我可能知道是什么导致了这个问题,“#face-face”是页面中的 js 用来加载特定部分的哈希链接网站,而 BeautifoulSoup 可能对此有一些问题

【讨论】:

  • 正如目前所写,您的答案尚不清楚。请edit 添加其他详细信息,以帮助其他人了解这如何解决所提出的问题。你可以找到更多关于如何写好答案的信息in the help center
猜你喜欢
  • 1970-01-01
  • 2021-08-20
  • 2018-04-04
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-04-07
相关资源
最近更新 更多