【发布时间】:2017-08-12 04:16:20
【问题描述】:
我正在尝试从http://www.sports-reference.com/cbb/schools/duke/2010.html 获取第 6 个(或“高级”)表。
使用 htmltab 或 XML,我已经能够使用整数引用(即 1 用于第一个表,2 用于第二个等)或 XPath 来抓取表 1 到 3。不过,我不能使用相同的方法刮掉表 4、5 或 6。
library(htmltab)
url <- "http://www.sports-reference.com/cbb/schools/duke/2010.html"
duketable1 <- htmltab(doc = url, which = 1) #Using number
duketable1 <- htmltab(doc = url, which = "//*[@id='all_roster']") #Using XPath
无法使用相同的框架抓取表 6(或 4 和 5)。
duketable6 <- htmltab(doc = url, which = 6)
duketable6 <- htmltab(doc = url, which = "//*[@id='all_advanced']")
与 XML 相同(仅读取前三个表)
library(XML)
url <- "http://www.sports-reference.com/cbb/schools/duke/2010.html"
tables <- readHTMLTable(url)
names(tables)
我最好的猜测是<div class="adblock"> 正在影响某些东西,但我不知道如何解决它。提前感谢您的任何提示。
【问题讨论】:
标签: r xml xpath web-scraping