【发布时间】:2016-12-02 15:34:31
【问题描述】:
我有一个逐秒值的 CSV,如下所示:
"x","timestamp","value"
"1",2016-01-01 00:00:00,124
"2",2016-01-01 00:00:01,121
"3",2016-01-01 00:00:02,NA
"4",2016-01-01 00:00:03,NA
"5",2016-01-01 00:00:04,NA
"6",2016-01-01 00:00:05,123
"7",2016-01-01 00:00:06,122
"8",2016-01-01 00:00:07,124
"9",2016-01-01 00:00:08,NA
"10",2016-01-01 00:00:09,124
所以有一些数据丢失并标记为NA。现在我想制作丢失数据块长度的直方图。在给定的示例中,这意味着计算有多少缺失数据块的长度为1 sec (1)、2 sec (0)、3 sec (1) 等等。
在我的现实生活数据集中,bins/intervals 会有点不同,我想到了这八个类别:
= 1 sec
2 to 5 sec
6 to 10 sec
11 to 30 sec
31 to 300 sec
301 to 3600 sec
3600 to 86400 sec
> 86400 sec
所以我的想法是让 R 代码遍历 CSV 的所有行,并且每当它检测到 NA 值时,对行数进行计数,直到它再次找到真正的值。这八个类别可以是一个整数变量,每次检测到NA-values 的拟合块时,都会向上计数+1。
作为一个完整的 R-noob,我只是不知道该怎么做。非常感谢您的帮助:)
【问题讨论】:
-
使用游程编码。请参阅
?rle的帮助。
标签: r csv time-series histogram missing-data