【问题标题】:How to cluster customers with the model (Customer -> Item list -> Word list in items) with an unsupervised algorithm如何使用无监督算法将客户与模型(客户 -> 项目列表 -> 项目中的单词列表)进行聚类
【发布时间】:2020-04-15 12:21:13
【问题描述】:

需要有关聚类模型的建议。有一个客户列表 -> 客户有一个产品列表 -> 每个产品包含几个单词。 我想按活动类型(即一般主题)将客户分成几组。

您将如何引入这种用于向量聚类的模型,例如 K-means?

到目前为止,我的假设是 - 将每个单词变成一个 fasttext 向量,例如在 TF-IDF 上选择前 100 个单词,然后将 * 100(fasttext 向量的大小)乘以 100 个单词,这将变成 10,000列。也许在计算方面更经济?

【问题讨论】:

    标签: nlp cluster-analysis


    【解决方案1】:

    这与推荐系统非常相关。我建议阅读有关基于内容与协同过滤推荐系统的文章。一个好的介绍是this blog post

    因此,您可以基于许多属性进行聚类。你提出的想法可能会奏效。如果你有关于产品的领域知识,你可以在寻找词向量之前诉诸这一点。例如,假设所有产品都是货架。你可以直接对产品进行矢量化,比如说

    vec = [
        width,
        depth,
        height,
        width * depth,  # footprint/surface area is important on its own
        width * depth * height,
        color,  # numeric representation
        popularity,  # possibly using a metric like sales
    ]
    

    这只是一个示例,但它展示了如何在不借助 NLP 的情况下直接对产品进行矢量化。

    如果您无法想到直接矢量化您的产品,并且您不/不能使用协同过滤(可能是冷启动问题),那么您可能需要考虑矢量化整个产品描述使用Universal Sentence Encoder,无论输入大小如何,都会输出512维向量。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-02-21
      • 2016-04-25
      • 1970-01-01
      • 2018-11-11
      • 1970-01-01
      • 2013-11-30
      • 2021-11-17
      相关资源
      最近更新 更多