【问题标题】:Computing similarity matrix with mixed data用混合数据计算相似度矩阵
【发布时间】:2017-01-07 18:55:27
【问题描述】:

我也在“交叉验证”论坛上问过这个问题,但到目前为止还没有答案,所以我也在这里尝试:

我想根据我的数据(来自汽车公司的故障数据)计算相似度矩阵(我将进一步将其用于聚类目的)。数据由以下变量组成:

开始日期 + 时间 (dd/mm/yyyy hh/mm/ss)、持续时间(以秒为单位)、星期几(周一、周二、...)、工作团队 (1,2,3),本地化 (1,2,3,...,20),失败类型

由此可见,有连续的和分类的数据。您建议使用什么方法来计算故障类型之间的相似性?我想我不能使用欧几里得距离,或者 Gowe 的相似度。提前谢谢你。

【问题讨论】:

  • 这取决于你的目的。您想定义相似性的目的是什么?
  • 因为我想对数据进行聚类分析(层次聚类)
  • 您应该给其他人一周的时间来回答,而不是 5 小时。不要交叉发布,交叉验证是更好的提问方式。
  • @Anony-Mousse 如果我在这里发布一个 c# 问题,我通常会在 5 分钟左右得到回复。我很诚实并承认我正在重新发布这个问题,因为在交叉验证后,标签并没有像这里那样被很好地遵循。我无法等待一周的有用答案。

标签: cluster-analysis data-mining similarity categorical-data


【解决方案1】:

不,您需要一个特设函数来代表您对数据在现实世界中的含义的了解。据推测,它将主要对连续差异应用权重,并为离散的分类变量应用二维简单矩阵。但不要统治我们对极端值或模糊化的审查。

【讨论】:

  • 我害怕我不明白你的意思:) 你能更具体点吗?也许一个例子会有所帮助。我想计算矩阵,因此我将能够执行层次聚类并找到故障类型之间的关系。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2017-11-07
  • 1970-01-01
  • 2016-02-15
  • 2014-03-25
  • 2016-10-22
  • 2018-08-01
相关资源
最近更新 更多