【发布时间】:2014-09-20 10:00:09
【问题描述】:
我正在尝试将 url 表放入 data.frame。在其他示例中,我发现以下代码有效:
library(XML)
library(RCurl)
theurl <- "https://es.finance.yahoo.com/q/cp?s=BEL20.BR"
tables <- readHTMLTable(theurl)
正如警告所说,该表似乎不是 XML
Warning message:
XML content does not seem to be XML: 'https://es.finance.yahoo.com/q/cp?s=BEL20.BR'
或者,getURLContent(theurl, ssl.verifypeer = FALSE, useragent = "R") 可以工作,但不知道如何提取表格。任何帮助将不胜感激。
编辑:感谢@har07 使用table <- readHTMLTable(getURLContent(theurl, ssl.verifypeer = FALSE, useragent = "R"))$ yfncsumtab 提供了输出,但仍需过滤。
【问题讨论】:
-
将
getURLContent的结果作为readHTMLTable()的参数传递? -
@har07 谢谢,这是一个很好的改进。我可以考虑使用
grep查找标头的索引,然后提取表格,但是有没有一种有效的方法可以将表格直接提取到数据框中? -
你真的不应该在 xml/html 内容上使用
grep。 -
使用
ssl.verifypeer = FALSE是一个非常糟糕的主意。 -
@AP13 使用
httr来设置 RCurl 以避免出现问题
标签: xml r web-scraping rcurl