【发布时间】:2020-02-25 14:57:28
【问题描述】:
我目前正在尝试从以下 html 页面上的两个图表中抓取数据(来自那里列出的两个图表的信息:Forsmark 和 Ringhals):https://group.vattenfall.com/se/var-verksamhet/vara-energislag/karnkraft/aktuell-karnkraftsproduktion
数据来源于这样的脚本标签(片段)
<script type="text/javascript">
/*<![CDATA[*/ productionData = JSON.parse("{\"timestamp\":1582642616000,\"powerPlant\":\"Ringhals\", // etc
</script>
我想要两个如下所示的数据框:
F1 F2 F3
number number number
和
R1 R2 R3
number number number
我尝试使用 XML 和 xpath 来解析一个 html 页面,但没有得到任何结果。
你有什么想法吗?
谢谢!
【问题讨论】:
-
你在刮什么? Forsmark 和 Ringhals 的(基础数据)图表?
-
是的,它们存储在 HTML 中的
-
那些图表是
<iframe>s,从gvp.vattenfall.com/sweden/produced-power/iframe/forsmark 和gvp.vattenfall.com/sweden/produced-power/iframe/ringhals 加载,我现在看到了。由于该页面上有大量脚本标签,因此添加地标会很有帮助,例如“包含productionDataJSON 的脚本标签。”
标签: html r json web-scraping