【发布时间】:2017-06-28 16:56:24
【问题描述】:
我有一小段代码可以将数据帧从长转换为宽。
library(reshape2)
mydata <- structure(list(issn = c("1980-4814", "1945-3116", "1681-4835", "1367-0751", "1516-6104", "1359-7566", "2319-0795", "1390-6615", "1808-8023", "1746-4269", "1852-2181", "0022-4596", "1808-2386", "0254-6051", "1981-3686", "1077-2618", "1809-3957", "2179-5746", "0147-6513", "1070-5503"), periodico = c("ABCustos (", "Journal of", "The Electr", "Logic Jour", "DIREITO, E", "REGIONAL &", "REVISTA FÓ", "UMBRAL: RE", "Segurança ", "Journal of", "Augm Domus", "Journal of", "BBR. Brazi", "Jinshu Rèc", "Revista Br", "IEEE Indus", "Revista SO", "Biota Amaz", "Ecotoxicol", "Internatio"), qualis = c("B4", "B3", "B2", "B2", "A1", "B5", "B5", "C ", "B5", "B3", "B3", "A1", "B4", "B3", "B5", "A2", "C ", "B3", "A2", "B1"), area = c(1L, 1L, 1L, 2L, 3L, 3L, 3L, 3L, 4L, 5L, 6L, 6L, 7L, 7L, 7L, 8L, 8L, 9L, 9L, 9L)), .Names = c("issn", "periodico", "qualis", "area"), row.names = c(1L, 501L, 1001L, 1501L, 2001L, 2501L, 3001L, 3501L, 4001L, 4501L, 5001L, 5501L, 6001L, 6501L, 7001L, 7501L, 8001L, 8501L, 9001L, 9501L), class = "data.frame")
reshape(mydata, direction = "wide",
idvar = c("issn", "periodico"),
timevar = "area")
结果是
没关系,只是我想要的,但是随着数据框增长到超过 2000 条记录,它变得非常慢。
我只有 10 个区域要映射到列,但是超过 10.000 个 issn。
我正在寻找更快的方法来获得相同的结果。
谢谢
【问题讨论】:
-
使用
dcast来自data.table。我认为dcast解决方案已经在您发布的类似问题的早期欺骗链接中 -
@akrun dcast 解决方案不再像我在其他地方的类似帖子中所展示的那样工作。由于我对英语的限制,您似乎不清楚。我在这里找到的答案并不能解决分类/名义数据问题,它们以聚合数值为中心,这不是我的情况。
-
不知道为什么它不起作用
dcast(setDT(mydata), issn+periodico~area, value.var = "qualis")得到与您的reshape输出相似的输出 -
@akrun 快把我逼疯了。我很快就收到了你的 dcast 建议,但是使用这个提取的小数据帧,它与原始数据帧相比很好,它给了我 dcast(setDT(dfPub), issn+periodico ~ area, value.var = "qualis") 缺少聚合函数,默认为“长度”。在两个 df 中运行 str 它们显示相同的结构。
-
@akrun 可能与编码有关,我不知道,但请检查一下,在 dcast(setDT(dataset[1:1789,]), issn+periodico ~ area, value.var = "qualis") 然后突然把它改成了 1790 记录。
标签: r performance dataframe reshape