【问题标题】:HTML does not reflect webpage content in browser for Beautiful SoupHTML 不反映 Beautiful Soup 浏览器中的网页内容
【发布时间】:2017-05-20 14:51:52
【问题描述】:

我正在尝试使用 Beautiful Soup 从网站上抓取内容。在做一些测试时,我得到以下输出(这只是最后的最后一点):

<!-- 6. Load the app --> 
 <my-app>
    Loading...
 </my-app>

</body>

</html>

“加载”部分是我想要的。为什么没有为此加载html?如果我在 Google 中查看源代码,也会发生同样的事情。看不到代码怎么刷。

有问题的页面是:

https://searchusan.ama-assn.org/finder/usan/search/*/relevant/1

谢谢。

【问题讨论】:

    标签: python html beautifulsoup


    【解决方案1】:

    Beautiful Soup 会加载它在页面首次呈现时看到的页面。不幸的是,您尝试抓取的页面使用 javascript 在初始页面加载后呈现您想要的信息。 Javascript 总是给 Beautiful Soup 带来问题,而我使用 javascript 使用的唯一纯 Beautiful Soup 解决方案非常麻烦、缓慢并且容易崩溃/挂起。

    我建议您使用 Selenium 之类的工具和 Beautiful Soup,它可以加载整个页面。

    这里是一个例子:Python Scraping JavaScript using Selenium and Beautiful Soup

    【讨论】:

    • 感谢您的回复。我会试试看。如果我在 google 中获得了检查器元素,我会看到我想要的信息。有没有办法从那里获取数据?
    • 不,您看到该信息的原因是,当您在检查器中查看它时,javascript 已加载。您可以从那里获取它的唯一方法是等到它加载然后手动将网页保存到您的文件系统并刮掉它。但这不是一个自动化的解决方案。
    • 一个后续...为什么,即使页面加载显示后,源代码仍然显示'正在加载'?
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2021-03-06
    • 2022-10-02
    • 2013-07-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多