【发布时间】:2020-09-22 15:14:06
【问题描述】:
目前正在清理接近 1500 万行的数据子集。最终将使用接近 1.2 亿行的完整数据集。
我的部分数据是以小时为单位的日期,分为两列。一列具有日期 (1/1/2020) 格式,另一列具有与该日期相对应的整数形式的小时。
我已经使用以下代码成功实现了我的目标:
library(tibble)
library(lubridate)
df <- tibble(date = rep(c(mdy("1/1/2020")), each = 5), hour = 1:5)
hour(df$date) <- df$hour
在我的(相当强大的)机器上运行完整的 15M 行需要 120 秒。我通常不使用这么大的数据集,这对我来说似乎很慢,但我充其量只是一个扶手椅编码器。
这是实现我的目标的合理时间范围吗?如果没有,是否有其他功能或更有效的方法来实现相同的结果?
【问题讨论】:
标签: r performance lubridate tibble