【问题标题】:Download a webpage using python 3 that contains script with data使用 python 3 下载包含数据脚本的网页
【发布时间】:2018-09-10 03:19:20
【问题描述】:


我有这个website,我想在其中获取这个网页的数据。所以我在 python 3 中尝试了这段代码。

from urllib.request import urlopen
html = urlopen("https://finance.yahoo.com/quote/MSFT/financials?p=MSFT").read()

f = open("D:/source.html", "wb")
f.write(html)
f.close()

问题是下载的页面不包含表中的所有数据,如果您检查网站,该表有两部分数据,即年度和季度,季度部分未显示在结果中。
我尝试使用另一个库来完成这项任务,它使用季刊中的数据下载整个页面,当我比较这两个网页时,我从库中获得的一个比另一个下载的大一点上面的代码。
想在标准 python 3 中执行此操作。
我也不知道在这部分要搜索什么或如何调用此类网页,所以我需要帮助才能知道为什么网页没有完全下载?以及如何解决它。
提前致谢。

【问题讨论】:

    标签: python python-3.x


    【解决方案1】:

    我相信您要访问的网站会阻止抓取,因此您应该尝试模拟以下问题所涵盖的浏览器。 Python browser emulator with JS support

    【讨论】:

    • 我厌倦了使用 Python Selenium,但页面永远不会完成加载,所以即使我设置了等待时间然后得到结果,我也无法获取 html,它下载了没有满桌。告诉我你是否想让我写我做的代码,但这是一个简单的普通代码示例,它使用 driver.get("URL") 加载网页,然后获取页面源代码 driver.page_source 告诉我这是否错误。跨度>
    • 浏览网页后,似乎季度选项卡没有打开的原因是因为它是在反应后端使用 ajax 动态创建的,使用 urlopen 将下载当前没有季度详细信息的页面。至于如何继续,请尝试修复您的 selenium 页面,如果您可以发布错误或使用 pyQT webkit
    猜你喜欢
    • 2015-09-21
    • 1970-01-01
    • 1970-01-01
    • 2011-08-09
    • 2015-03-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-01-15
    相关资源
    最近更新 更多