【发布时间】:2011-05-23 19:55:52
【问题描述】:
这是我正在尝试执行的 R 中的一个小项目。我已经抓取了几百个 html 页面。我可以使用带有 R 的 XML 库中的 reaHTMLTable 函数来读取我感兴趣的表。但是我在编写 for 循环以遍历目录、从每个文件中获取表并附加它们时遇到了麻烦到单个 CSV 文件。
我已经成功地遍历文件并将每个表保存到单个 txt 文件中(我觉得这至少是一个开始):
library(XML) # htmlTreeParse
parentpath <- "Z:/scraping"
setwd(parentpath)
filenames <- list.files()
for (targetfile in filenames){
setwd(parentpath)
data = readHTMLTable(targetfile)
outputfile <- paste(targetfile,'.txt', sep="")
write.table (data[6], file = outputfile , sep = "\t", quote=TRUE)
【问题讨论】:
-
你试过
append = TRUE使用单个文件名吗?