【问题标题】:What clustering I should use to cluster colleges into similar comparison groups?我应该使用什么聚类将大学聚类到类似的比较组中?
【发布时间】:2014-03-20 17:12:52
【问题描述】:

我是集群新手,不知道如何选择应用哪种集群方法。

我的数据是大约 1303 所学院/大学和 35 个变量,例如收到/接受的申请、学生的综合 SAT 分数、毕业率......等等

这是description of my datadataset

当我想将大学聚类到相似的比较组中时,哪种聚类会更好,比如毕业率?

我尝试了完整的链接方法 --- hclust in r 但它的情节在底部只是一团糟......

有什么建议可以让我用我的数据集在 r 中进行更好的聚类?谢谢!

【问题讨论】:

标签: r cluster-analysis hierarchical-clustering


【解决方案1】:

选择一个好的距离/相异度指标将对hclust的结果产生显着影响。我猜默认情况下它会选择一些欧几里得距离度量,这意味着每个变量在其特征空间中的权重相同。

一个更好的主意是自己提出一个相异函数:给定两所大学的一个函数将得出它们之间的相异性。您可以将您对数据中的指标的理解以及任何其他先验信息与此函数相结合,然后自己计算相异矩阵dhdist 的参数)。

如果您想关注毕业率,那么您的相异函数在最极端的情况下可能只会产生这种差异。但是,如果您认为毕业率和其他一些因素都很重要,然后创建一个将两者都考虑在内的相异函数,但赋予毕业率更大的权重,它会变得更有趣。

那么层次聚类结果应该更好地从数据中提取有趣的模式。

【讨论】:

  • 所以当我寻找差异时,据我所知,我需要找到最远的点,在我的情况下,考虑两个具有最大差异的毕业率?因为我想按毕业率对大学进行聚类……或者我确实需要在数据中包含其他变量?谢谢!
  • 已经扩展了我的答案:这就是对相异性进行层次聚类的问题,分析师可以设计一个只关注特征子集的函数(因为它们对于特定研究来说是最重要的)或将所有这些都考虑在内。
  • 您好,感谢您提供详细信息!我尝试了不同的方法来聚类和构建图。在我看来,分类树似乎更好。
猜你喜欢
  • 2015-06-15
  • 2016-07-03
  • 2016-05-07
  • 1970-01-01
  • 2020-02-28
  • 2019-06-14
  • 1970-01-01
  • 2016-09-03
  • 1970-01-01
相关资源
最近更新 更多