【发布时间】:2013-03-23 07:12:42
【问题描述】:
我想对一些包含每日点击率的曲线进行聚类。 数据集是时间序列的点击率数据。
y1 = [time1:0.10,time2:0.22,time3:0.344,...]
y2 = [time1:0.10,time2:0.22,time3:0.344,...]
我不知道如何使用 kmeans 测量两条曲线的相似性。 有没有为此目的的论文或一些图书馆?
【问题讨论】:
-
时间序列的长度是否相同?如果是这样,您可以直接尝试。如果没有,您可能想使用kernel k-means 进行操作,比如说。 dynamic time-alignment kernel 或类似名称。
-
@Dougal 日期集的长度不相等,可能 y1 包含 40 个点,y2 包含 29 个点。
-
您能否阐明数据集的结构?最初我认为它们是每个时间段的点击率(例如,每 10 分钟),但如果它们的大小不同,那就不可能了。好像也不是日志——那么time1、time2是怎么确定的呢?
-
我假设您正在尝试对具有类似“点击率季节性”模式的项目进行分组/聚合,对吗?
标签: math cluster-computing data-mining cluster-analysis probability