【发布时间】:2018-11-04 23:53:59
【问题描述】:
我正在尝试对客户运行机器学习模型,试图将使用类似产品的客户进行细分。我的数据集很大,有 240 万条记录,格式如下:
customer_id prod_1 prod_2 prod_3 prod_4 ..... prod_10
000 1 0 0 1 ..... 1
001 0 0 1 1 ..... 1
011 0 1 0 1 ..... 0
021 1 0 1 1 ..... 0
...
每一行都有客户编号和 1 或 0,取决于他们是否有产品。我运行了 k-means,结果看起来并不令人印象深刻。
关于可以在此类数据上运行哪种类型的模型,以根据客户一起使用的产品对客户进行细分,还有其他建议吗?
【问题讨论】:
-
查看关联规则,更具体的是
arules包 -
您在 k-means 中使用了哪个相似度指标?有好几个。
标签: python r machine-learning cluster-analysis data-science