【发布时间】:2018-04-24 15:28:36
【问题描述】:
我有一个包含两列的 data.frame。第二列是文件名。
df <- data.frame(paragraph = "Lorem ipsum dolor sit amet, consetetur sadipscing elitr, sed diam nonumy eirmod tempor invidunt ut labore et dolore magna aliquyam erat, sed diam voluptua.",
filename = "./data/RevCon_2015_C1_Austria_05_06.txt", stringsAsFactors = FALSE)
如何从第二列中提取某些字符串(使用stringr)并将它们添加(使用dplyr::mutate)作为附加变量(会议、年份、国家等),以便得到以下结果:
df2 <- data.frame(paragraph = "Lorem ipsum dolor sit amet, consetetur sadipscing elitr, sed diam nonumy eirmod tempor invidunt ut labore et dolore magna aliquyam erat, sed diam voluptua.",
filename = "./data/RevCon_2015_C1_Austria_05_06.txt", conference = "RevCon", year = "2015", country= "Austria", date = "06.05.2015", stringsAsFactors = FALSE)
【问题讨论】:
-
filename列中的所有条目是否具有相同的模式? IE。./data/{conference}_{year}_{ignored}_{country}_{month}_{day}.txt? -
大部分,是的。有一些例外,但我想我可以过滤它们并在第二次运行中提取这些信息,然后加入两个数据集