【发布时间】:2023-03-31 19:27:01
【问题描述】:
我无法抓取网站上的数据。我能够抓取文本,但是当我尝试提取 url 时出现错误。
这是网址:https://www.horizont.net/suche/OK=1&i_q=der&i_sortfl=pubdate&i_sortd=desc&currPage=1
到目前为止,我正在使用这个:
r=requests.get('https://www.horizont.net/suche/OK=1&i_q=der&i_sortfl=pubdate&i_sortd=desc&currPage=1')
c = r.content
soup = BeautifulSoup(c, 'html.parser')
all = soup.find_all('a', {'class': 'ArticleTeaserSearchResultItem_link'}, href = True)
for item in all:
print(item.find_all('h2')[0].text)
输出:
Schweizer Illustrierte und L'illustré rücken näher zusammen
"En Garde" und andere Geschichten über Mut und Beharrlichkeit
Hüttenzauber - der TV-Spot zu Weihnachten
Neuwagen in Deutschland müssen künftig DAB+ empfangen können
Schiess Werbig mit neuen Storys
Thjnk-Manager Sebastian Schlosser kommt als Chief Marketing Officer
Die Einreichungsphase läuft bis zum 30. November
Ipsos / Sinus / YouGov / Appinio / Axis / GfK
Pro Sieben Sat 1 plant Audio-Streaming-Plattform
Adidas und DFB blasen in Streifenoptik zum Angriff auf den EM-Titel
问题 1: 我仍然无法抓取搜索中的网址
问题 2: 搜索结果包含大约 15000 个页面,我想抓取所有网址。
【问题讨论】:
-
你的网址不正确,应该是
https://www.horizont.net/suche/?OK=1&i_q=der&i_sortfl=pubdate&i_sortd=desc&currPage=1
标签: python beautifulsoup request