【发布时间】:2014-08-11 17:04:52
【问题描述】:
我一直在研究论文中回顾期望最大化 (EM):
http://pdf.aminer.org/000/221/588/fuzzy_k_means_clustering_with_crisp_regions.pdf
我有一些疑问,我还没有弄清楚。例如,如果每个数据点有多个维度,会发生什么?
例如,我有以下具有 6 个数据点和 4 个维度的数据集:
>D1 D2 D3 D4
5, 19, 72, 5
6, 18, 14, 1
7, 22, 29, 4
3, 22, 51, 1
2, 21, 89, 2
1, 12, 28, 1
这意味着为了计算期望步长,我需要计算 4 个标准差(每个维度一个)吗?
我是否还必须计算假设 k=3 的每个集群的方差(不知道是否有必要根据论文中的公式...)或仅计算每个维度的方差(4 个属性)?
【问题讨论】:
-
EM 是一个工具,而不是一个目标。为了将其应用于某些问题,您首先必须说明您要解决的问题。仅根据您的数据,可以构建许多不同的问题,并为您的问题提供不同的答案。
-
您好 Pentadecagon,谢谢!我知道 EM 是一种技术,而且有很多论文对算法的实现如此不同:(...但我想知道是否存在一些问题,我只需要为每个维度计算不同的 sigma 或计算 sigma每个集群?在关于 EM 的论文中,他们只声明 sigma 是随机选择的,并且只显示数据点的一个维度。
标签: algorithm machine-learning data-mining expectation-maximization