【问题标题】:KMeans: Extracting the parameters/rules that fill up the clustersKMeans:提取填充集群的参数/规则
【发布时间】:2019-09-02 01:22:02
【问题描述】:

我在 scikit learn (Python) 中创建了一个 4 集群 k-means 客户细分。我们的想法是,每个月,企业都会了解每个集群中客户规模的变化情况。

我的问题是如何使这些集群“耐用”。如果我用更新的数据重新运行我的脚本,集群的“边界”可能会略有变化,但我想保留旧的集群(即使它们与数据的匹配度稍差)。

我的猜测是应该有一种方法可以提取参数来决定哪种情况进入各自的集群,但我还没有找到解决方案。

如果有任何帮助,我将不胜感激

【问题讨论】:

  • 您到底想保留什么?每次您根据数据运行集群时,K 均值的工作方式都会发生变化。您可以为数据中的每个项目存储集群预测。
  • 假设我有二维数据,其中低于 x = 0.1 和高于 y = 0.9 的所有内容都被标记为集群 1。新数据进入,算法重新训练,现在一个高于 0.85 的案例也被标记为集群 1。这是我想防止的,我想保留旧规则,这样我就不必不断地调查集群的“含义”。我接受拟合优度的损失。我在其他地方也问过这个问题,有人建议我记录每个集群的平均值,并查看新病例如何最接近这些平均值。

标签: python scikit-learn k-means


【解决方案1】:

在不同的主题中得到答案:

只记录集群的意思。然后当新数据进来时,将其与每个平均值进行比较,并将其放入平均值最接近的那个。

【讨论】:

    猜你喜欢
    • 2016-11-09
    • 2019-04-04
    • 2017-06-01
    • 1970-01-01
    • 1970-01-01
    • 2017-04-06
    • 2013-07-15
    • 2017-07-28
    • 1970-01-01
    相关资源
    最近更新 更多