【发布时间】:2017-01-07 18:55:27
【问题描述】:
我也在“交叉验证”论坛上问过这个问题,但到目前为止还没有答案,所以我也在这里尝试:
我想根据我的数据(来自汽车公司的故障数据)计算相似度矩阵(我将进一步将其用于聚类目的)。数据由以下变量组成:
开始日期 + 时间 (dd/mm/yyyy hh/mm/ss)、持续时间(以秒为单位)、星期几(周一、周二、...)、工作团队 (1,2,3),本地化 (1,2,3,...,20),失败类型
由此可见,有连续的和分类的数据。您建议使用什么方法来计算故障类型之间的相似性?我想我不能使用欧几里得距离,或者 Gowe 的相似度。提前谢谢你。
【问题讨论】:
-
这取决于你的目的。您想定义相似性的目的是什么?
-
因为我想对数据进行聚类分析(层次聚类)
-
您应该给其他人一周的时间来回答,而不是 5 小时。不要交叉发布,交叉验证是更好的提问方式。
-
@Anony-Mousse 如果我在这里发布一个 c# 问题,我通常会在 5 分钟左右得到回复。我很诚实并承认我正在重新发布这个问题,因为在交叉验证后,标签并没有像这里那样被很好地遵循。我无法等待一周的有用答案。
标签: cluster-analysis data-mining similarity categorical-data