【发布时间】:2021-02-14 16:10:03
【问题描述】:
我有一个大型数据集,如下所示:
时间戳 事件
2020-03-04 01:20:39 A
2020-03-04 01:21:22 B
2020-03-04 01:21:55 C
2020-03-04 01:22:31 A
2020-03-04 01:23:19 B
2020-03-04 01:24:39 D
.
.
.
.
.
.
.
.
2020-03-10 11:34:54 C
2020-03-10 11:35:22 A
2020-03-04 11:35:55 B
2020-03-04 11:36:01 D
我想找出事件发生中是否存在某种模式。例如,在第 1 行的事件 A 之后,B 在第 2 行发生。{A,B} 是在第 4 行和第 5 行重复的模式。我想知道是否还有更多这样的模式及其频率。我对最大长度为 4 的序列感兴趣(例如:C、A、B、D)。
如果您能建议我使用 python 中的任何算法/实现来做这件事,那将非常有帮助。
谢谢!
【问题讨论】:
-
你在那个大数据集中有多少行? 10万? 100M ?
标签: python pandas machine-learning sequence data-analysis