【发布时间】:2019-01-28 05:59:27
【问题描述】:
我有一个非常简单的问题。我试图从linkedIn 页面的html 中获取职位描述,但我没有得到页面的html,而是得到了几行看起来像javascript 代码的行。我对此很陌生,因此将不胜感激任何帮助!谢谢
这是我的代码:
import requests
url = "https://www.linkedin.com/jobs/view/inside-sales-manager-at-stericycle-1089095836/"
page_html = requests.get(url).text
print(page_html)
当我运行它时,我没有得到我期望的包含职位描述的 html...我只是得到了几行 javascript 代码。
【问题讨论】:
-
似乎对我有用。你能分享你得到的输出吗?
-
返回的JS代码其实是window.onLoad()事件绑定的函数。我怀疑页面的其余部分是使用客户端代码加载的,因此您需要先执行该代码以检索生成的 HTML。可能的解决方案可以在here 中找到
-
谢谢先生,感谢您的回复……您说的很有道理,我认为您是对的。我终于让它与 Selenium 一起工作了……这是一个比 Beautiful Soup 更容易的解决方案。祝你有美好的一天! :-)
-
Anwarvic 完全正确。只想添加需要定义 webdriver_path ,否则您将收到“找不到 chromedriver 错误”。
标签: python-3.x web-scraping beautifulsoup python-requests