【发布时间】:2018-10-31 10:40:21
【问题描述】:
我正在尝试从该网页上的容器中抓取内容:https://www.check24.de/handytarife/vergleich?activeForm=sim
我通常使用 beautifulsoup 进行网页抓取,但在这种情况下,我发现它不适用于该网站。当我运行“soup”时,我只获得了网站架构的详细信息,而不是网站上可用容器中的内容。
page_link = 'check24.de/handytarife/vergleich?activeForm=sim'
page_response = requests.get(page_link, timeout=5, verify=False, headers={'User-Agent': 'Mozilla/5.0'})
soup = BeautifulSoup(page_response.text,'lxml')
你知道有什么好的 Python 库可以做我想做的事情吗?
最好, 山姆
【问题讨论】:
-
分享您的代码以及当前和所需的输出
-
page_link = 'check24.de/handytarife/vergleich?activeForm=sim' page_response = requests.get(page_link, timeout=5, verify=False, headers={'User-Agent': 'Mozilla/5.0'}) soup = BeautifulSoup (page_response.text,'lxml')
-
我想获取网站上每个容器中的所有项目。例如,LTE Special、LTE All 3 GB...
-
requests无法处理没有架构的 URL。这是你的第一个问题。第二个问题是您请求的页面不包含所需的数据。 -
我真的不明白为什么它不包含所需的数据?
标签: python web-scraping beautifulsoup containers