【问题标题】:Reducing number of groups of overlapping objects减少重叠对象组的数量
【发布时间】:2018-02-12 05:30:25
【问题描述】:

我有一长串对象组。每个对象都有简单的属性,例如名称和描述。它们已经与相似的对象分组,但我知道许多组在某种程度上是冗余或重叠的。列表不包含重复的对象,顺序无关紧要。

关于如何根据相似性将它们减少到“n”组的任何建议?谢谢。

字符串的Ie

["apple", "orange", "pear"]
["apple", "steak", "orange"]
["steak", "burger"]

前两个大致上最相似

【问题讨论】:

  • 而你如何定义相似?
  • 嗨,我通过在列表中拥有相同的对象集来定义它。如果有意义的话,该对象可以被视为一个简单的字符串或数字。

标签: python algorithm statistics probability


【解决方案1】:

也许您可以尝试设置一个矩阵,其中列数对应于数据集中不同单词的数量。行数是数据点的数量。那么条目 (i,j) 是单词 j 在样本 i 中出现的次数。

一旦你有了这个矩阵,那么任何常见的聚类算法都可以工作,你可以用任何你喜欢的方式定义相似度。

【讨论】:

    猜你喜欢
    • 2017-08-17
    • 2019-03-26
    • 1970-01-01
    • 2021-04-02
    • 2018-09-03
    • 2020-12-30
    • 1970-01-01
    • 2019-01-26
    • 1970-01-01
    相关资源
    最近更新 更多