【发布时间】:2018-05-10 04:12:47
【问题描述】:
我想从以下链接中获取行业权重表:
http://portfolios.morningstar.com/fund/summary?t=SPY®ion=usa&culture=en-US&ownerCountry=USA
我想要的表格是网站源代码中的表格 6。我有以下用 R 编写的脚本:
library(rvest)
turl = 'http://portfolios.morningstar.com/fund/summary?t=SPY'
turlr = read_html(turl)
df6<-html_table(html_nodes(turlr, 'table')[[6]], fill = TRUE)
但是,当我运行脚本的最后一行时,我收到以下错误消息
out[j + k, ] 中的错误:下标超出范围
【问题讨论】:
-
正是您没有包含导致此错误的重要代码
-
您的目标表中有嵌入的图表和分组。在
html_table接受之前,您需要更改返回的节点。请参阅this question 以获得一些指导。 -
在 SO 上几乎有无数的 R + 抓取 + 晨星帖子。哪些没有可以帮助您的信息?我一直对此感到困惑,因为创建 q 比进行实际搜索需要更多的精力。
标签: r web-scraping html-table html-parsing rvest