【发布时间】:2020-06-23 09:20:15
【问题描述】:
Python 3.8.2 (default, Apr 8 2020, 14:31:25)
[GCC 9.3.0] on linux
Type "help", "copyright", "credits" or "license" for more information.
>>> from requests_html import HTMLSession
>>> session = HTMLSession()
>>> r = session.get('https://www.sahibinden.com/ilan/emlak-konut-gunluk-kiralik-holiday-business-suit-lux-otel-konforunda-suit-daireler-803346031/detay')
>>> r.html.find("#classifiedId")
[]
我运行了这段代码,但输出为空。我试过r.html.render(),但结果没有改变。我也尝试用 xpath 找到它,但仍然没有结果。我该如何解决?
【问题讨论】:
-
在我看来,网页源中没有id=classifiedId的元素。
-
您想获取什么信息?只有
Classified Id? -
i.imgur.com/sIuaCqO.png @Dmitry 但是,您应该通过 python 代码再次检查。获取原始内容。他们可能会发送较少的信息,例如使用通用用户代理。
-
@TinNguyen 你应该先登录这个网站。此网页未经登录无法打开。您可以使用 Python 以编程方式完成这些步骤。
-
有一个具有该 id 的元素。我正在尝试在右侧获取列表。用户代理是 Chrome。它不需要登录。
标签: python python-3.x web-scraping python-requests-html