【问题标题】:How to compute the variances in Expectation Maximization with n dimensions?如何计算具有 n 维的期望最大化的方差?
【发布时间】:2014-08-11 17:04:52
【问题描述】:

我一直在研究论文中回顾期望最大化 (EM):

http://pdf.aminer.org/000/221/588/fuzzy_k_means_clustering_with_crisp_regions.pdf

我有一些疑问,我还没有弄清楚。例如,如果每个数据点有多个维度,会发生什么?

例如,我有以下具有 6 个数据点和 4 个维度的数据集:

>D1 D2 D3  D4   
5, 19, 72, 5  
6, 18, 14, 1  
7, 22, 29, 4   
3, 22, 51, 1   
2, 21, 89, 2   
1, 12, 28, 1

这意味着为了计算期望步长,我需要计算 4 个标准差(每个维度一个)吗?

我是否还必须计算假设 k=3 的每个集群的方差(不知道是否有必要根据论文中的公式...)或仅计算每个维度的方差(4 个属性)?

【问题讨论】:

  • EM 是一个工具,而不是一个目标。为了将其应用于某些问题,您首先必须说明您要解决的问题。仅根据您的数据,可以构建许多不同的问题,并为您的问题提供不同的答案。
  • 您好 Pentadecagon,谢谢!我知道 EM 是一种技术,而且有很多论文对算法的实现如此不同:(...但我想知道是否存在一些问题,我只需要为每个维度计算不同的 sigma 或计算 sigma每个集群?在关于 EM 的论文中,他们只声明 sigma 是随机选择的,并且只显示数据点的一个维度。

标签: algorithm machine-learning data-mining expectation-maximization


【解决方案1】:

通常,您使用Covariance matrix,其中还包括差异。

但这真的取决于您选择的模型。最简单的模型根本不使用方差。 更复杂的模型只有一个方差值,即所有维度的平均方差。 接下来,您可以独立地为每个维度设置单独的方差;最后但并非最不重要的一个完整的协方差矩阵。这可能是最受欢迎的最灵活的 GMM。

根据您的实施,可能还有更多。

来自 R 的 mclust 文档:

单变量混合

“E” = 等方差(一维)
"V" = 变量方差(一维)

多元混合

“EII” = 球形,等体积
“VII” = 球形,不等体积
“EEI” = 对角线、相等的体积和形状
“VEI” = 对角线、不同的体积、相同的形状
“EVI” = 对角线、等体积、不同形状
“VVI” = 对角线,不同的体积和形状
“EEE” = 椭圆体、相等的体积、形状和方向
“EEV” = 椭圆形、等体积和等形状
“VEV” = 椭圆形,形状相同
"VVV" = 椭圆形,不同的体积、形状和方向

单个组件

"X" = 单变量正态
"XII" = 球面多元法线
"XXI" = 对角多元正态
"XXX" = 椭圆形多元正态

【讨论】:

  • 感谢 Anony-Mousse!实际上,我想从我发布的 EM 论文中编写算法,这与 udacity 课程相同:udacity.com/course/viewer#!/c-ud741/l-644878538/m-638188664 目前我正在计算每个维度的平均方差,在我的示例 4 中......我的问题是按照该实现,我应该计算每个维度(4 sigma)的方差并计算每个集群的 sigma 吗?
  • 我没有使用协方差矩阵,因为我假设所有维度都是独立的
猜你喜欢
  • 2013-02-09
  • 2019-03-24
  • 2023-02-10
  • 1970-01-01
  • 2013-01-26
  • 2014-05-25
  • 2013-05-23
  • 2021-05-03
  • 2021-05-31
相关资源
最近更新 更多