【问题标题】:Evaluating the performance of variational autoencoder on unlabeled data评估变分自编码器在未标记数据上的性能
【发布时间】:2022-10-01 15:19:30
【问题描述】:

我设计了一个对顺序时间序列数据进行聚类的变分自动编码器 (VAE)。 为了评估 VAE 在标记数据上的性能,首先,我在原始数据上运行 KMeans,并使用生成的标签与真实标签进行比较调整后的相互信息分数 (AMI).然后,在模型训练完成后,我将验证数据传递给它,在潜在向量上运行 KMeans,并使用 AMI 将生成的标签与验证数据的真实标签进行比较。最后,我比较了两个 AMI 分数,看看 KMeans 在潜在向量上的性能是否比原始数据更好。

我的问题是:当数据未标记时,我们如何评估 VAE 的性能?

我知道我们可以在原始数据上运行 KMeans 并为其生成标签,但在这种情况下,由于我们将生成的标签视为真实标签,我们如何将 KMeans 在原始数据上的性能与 KMeans 在潜在向量上的性能进行比较?

笔记:该模型是完全无监督的。训练过程中不使用标签(如果存在)。它们仅用于评估。

    标签: deep-learning cluster-analysis k-means autoencoder unsupervised-learning


    【解决方案1】:

    在无监督学习中,您可以通过使用标记数据或可视化分析来评估模型的性能。在您的情况下,您没有标记数据,因此您需要进行分析。一种方法是查看预测。如果您知道应如何标记原始数据,则可以定性评估准确性。另一种方法是,因为您使用的是 KMeans,所以可视化集群。如果集群分散成组,这通常是一个好兆头。但是,如果它们更靠近并重叠,则各个区域中的向量标记可能不太准确。或者,您可以使用某种指标来评估集群或提出自己的指标。

    【讨论】:

      猜你喜欢
      • 2019-01-22
      • 2022-01-14
      • 2014-02-15
      • 2013-12-20
      • 1970-01-01
      • 2017-01-10
      • 2017-04-19
      • 2020-03-01
      • 2013-06-04
      相关资源
      最近更新 更多