【问题标题】:Clustering nominal data聚类名义数据
【发布时间】:2016-04-22 17:08:50
【问题描述】:

我正在尝试将聚类算法应用于我的数据集。 我的数据集是电影,一些属性是名义上的。 例如:

movie 1:
[
IMDB popularity: 1.02
Genre: Drama
Sub-genre: Horror
Rating: 1.23%
]

movie 2:
[
IMDB popularity: 2.08
Genre: Comedy
Sub-genre: Animation
Rating: 0.72%
]

etc. etc.

我可以应用类似于 K-means 的东西吗? K-means 适用于距离,例如,如果我将“戏剧”标记为 0,将“恐怖”标记为 1,将“喜剧”标记为 2,将“动画”标记为 3——那么我实际上要说的是,例如“戏剧”与“恐怖”的关系比“喜剧”更密切(对于这个例子,它可能在某种程度上接近现实,但对于一般情况,很难将单词标记为数字并保持真实比率。 任何已知的算法可以解决这个问题?

【问题讨论】:

  • 你知道有一个 datascience.se 吗?

标签: algorithm cluster-analysis data-science


【解决方案1】:

针对特定问题的统计传统解决方案是将值编码为不同的变量:

  • IsHoror
  • 是喜剧 . . .

然后你可以对结果运行 k-means。

我会做两个 cmets。首先,确保以某种方式对值进行标准化(标准化或标准化主成分是两种典型方法)。

我更喜欢期望最大化聚类,它是 k-means 的连续变体,因为它通常会产生更好的结果。

【讨论】:

  • 我怀疑这种方法会产生任何可用的东西。
  • @Anony-Mousse 。 . .我在主成分聚类方面有很好的经验。但这是我的经验,你可能有其他经验。
  • 这显然对他的恐怖/喜剧例子没有帮助,怎么办?看看他的数据和他的问题。 PCA 或聚类无法处理此类数据。
猜你喜欢
  • 2018-05-04
  • 2012-05-24
  • 2015-09-26
  • 2019-10-29
  • 1970-01-01
  • 2013-04-09
  • 2023-03-24
  • 2023-03-12
  • 1970-01-01
相关资源
最近更新 更多