【发布时间】:2015-08-18 18:17:36
【问题描述】:
我在 R 中有一个 HTML 文档,我想从该文档中提取一个唯一标签列表,并计算它们的出现频率。
我可以按如下方式遍历每个可能的标签,但希望有一个不需要预定义标签列表的解决方案:
library('XML')
url <- 'http://stackoverflow.com/questions/11227809/why-is-processing-a-sorted-array-faster-than-an-unsorted-array'
doc <- htmlParse(url)
all_tags <- c('//p', '//a', '//b', '//u', '//i')
counts <- sapply(all_tags, function(x) length(xpathSApply(doc, x)))
free(doc)
【问题讨论】:
-
嗯
table(xpathSApply(doc, "//*", xmlName))? -
@lukeA 完美。让您的评论成为答案!
-
同意@lukeA 将他的作为答案发布,并且应该接受他的作为答案。我只为使用
xml2的人发布了Hadleyverse 版本,并且故意不包括XML/xpathSApply,希望Luke 会发布答案。 -
@hrbrmstr 谢谢!
标签: xml r web-scraping