【发布时间】:2016-01-16 18:58:09
【问题描述】:
假设我有一个事件列表。例如A, D, T, H, U, A, B, F, H, ...。
我需要的是找到完整序列中出现的频繁模式。在这个问题中,我们不能使用像先验或 fp 增长这样的传统算法,因为它们需要单独的项目集。而且,我不能将此流分成更小的集合。
知道哪种算法适合我吗?
编辑
例如,对于序列A, D, T, H, U, A, D, T, H, T, H, U, A, H, T, H 和min_support = 2。
频繁的模式将是
Of length 1 --> [A, D, T, H, U]
Of length 2 --> [AD, DT, TH, HU, UA, HT]
Of length 3 --> [ADT, DTH, THU, HUA]
Of length 4 --> [ADTH, THUA]
No sequences of length 5 and further
【问题讨论】:
-
我认为这个问题太宽泛了,但作为第一个猜测,你可能想看看iSAX
-
我只想在那个大流中找到各种长度的频繁模式。经过一番搜索,我在互联网上找不到任何东西。
-
"String" compression 算法试图利用(至少在局部)可预测的序列概率不均匀性。
-
@greybeard,我没有完全理解你。请您再解释一下。
-
据我所知,J.A. Storer 是使用 Original Pointer Macros (OPM)、External Pointer Macros、它们的组合和 引入“文本压缩”概念的人压缩指针宏(EPM、OEPM、CPM)——所有这些的最佳使用已被证明是棘手的。 (宏:(开始,长度))。在变化和限制中,在一个方向上使用原始指针只允许从另一端开始的线性解决方案;有关来自后缀树的可能目标的信息。 (几十年过去了,后缀数组可能是今天的选择。)
标签: algorithm data-mining frequency sequence-analysis