【发布时间】:2020-04-04 09:54:30
【问题描述】:
我正在尝试通过 BeautifulSoup 获取锚标记的 href,但它不检索查询字符串! 这是 html sn-p:
<td class="titleColumn">
143.
<a href="/title/tt1302006/?pf_rd_m=A2FGELUUNOQJNL&pf_rd_p=e31d89dd-322d-4646-8962-
327b42fe94b1&pf_rd_r=0GYQY7SGFV9AK9CV3019&pf_rd_s=center-
1&pf_rd_t=15506&pf_rd_i=top&ref_=chttp_tt_143"
title="Martin Scorsese (dir.), Robert De Niro, Al Pacino" >The Irishman</a>
<span class="secondaryInfo">(2019)</span>
</td>
这是soup返回的链接:
https://www.imdb.com/chart/top/?sort=us,desc&mode=simple&page=1/title/tt1302006/
这是我的代码:
import requests
from bs4 import BeautifulSoup
add="https://www.imdb.com/chart/top/?sort=us,desc&mode=simple&page=1"
r = requests.get(add)
soup = BeautifulSoup(r.text)
i=1;
for movie in soup.find_all("td",{"class":"titleColumn"}):
print (add+movie.find('a')['href'])
soup 中的链接也没有查询字符串
【问题讨论】:
-
您确定查询字符串在 HTML 中,而不是 JavaScript 之后添加的吗?
-
这不是问题,但感谢您的关注
-
首先,如果结果是 HTML 或 XML(以及其他),请使用
r.content而不是r.text。其次,它不检索查询字符串究竟是什么意思?它只返回一个字符串,这也恰好是错误的? 汤里的链接也没有查询字符串是什么意思? -
这与请求有关,我已尝试使用
cURL,更改用户代理并使用 urllib,但原始 HTML 不会像他所说的那样显示查询变量。
标签: python beautifulsoup