【发布时间】:2016-02-10 01:32:47
【问题描述】:
如何在一维数组上运行均值偏移聚类?
这是我的数据框:
>>>df
INFO FREQ
R2 31 0.2468213
R5 27 0.003670532
UR 25 0.00337465
我需要在“INFO”列上应用聚类。
我使用 reshape(-1,1) 命令解决了这个问题:
kmeans.fit(df["INFO"].values.reshape(-1,1)) ,但使用平均移位聚类我得到这个错误:
meanshift.fit(df["INFO"].values.reshape(-1,1)) 输出:ValueError: Invalid shape in axis 1: 0.
【问题讨论】:
-
你的数据真的有 3 个元素吗?
-
MeanShift 与长度 > 3 的随机一维向量完美匹配。所以问题是,为什么要将 kmeans、meanshift 或任何其他类型的聚类应用于 3 元素向量?你会因为它cool而应用它吗?因为它没有任何数学意义。
-
集群一个 3 元素数组真的很容易。它们中的每一个都是一个集群。不需要算法!耶!
-
我的完整数据集大约有 4500000 行,它是无法拟合 K(对于 K 均值)的自动过程的一部分
标签: python scikit-learn cluster-analysis