【发布时间】:2017-10-26 13:14:27
【问题描述】:
我正在尝试使用聚类来识别我的数据集中的波段。我正在处理供应链数据,所以我的数据如下所示:
相关列是每个的价格。
问题在于,有时我们错误地认为该产品是 100 件而不是 10 件,因此每件的价格看起来像 (2, 0.25, 3)。我想创建一个代码,仅当附加集群的平均价格比所有现有集群高或低至少 2 倍时才创建集群。
例如,如果我的每个价格是 (4, 5, 6, 13, 14, 15),我希望它返回 2 个质心分别为 5 和 14 的集群。另一方面,如果我的数据看起来像 (3, 4, 5, 6),它应该返回一个簇。
目标是创建一个代码,该代码返回已生成多个集群的项目的产品代码,以便我可以针对错误的计量单位(案例 100 与案例 10)审核这些产品代码。
我正在考虑使用分裂的层次聚类,但我不知道如何引入质心距离规则来创建新的聚类。
我是 R 的新手,但我有 SQL 和 Stata 经验,所以我正在寻找一个可以执行此操作的包或帮助我完成此操作所需的语法。
【问题讨论】:
-
请转至stackoverflow.com/questions/5963269/…,了解如何制作可复制的好帖子。 1)请将数据添加为文本,并确保显示您想要的输出。
标签: r cluster-analysis hierarchical-clustering outliers