【问题标题】:Bad clustering results with mahout on Reuters 21578 dataset在 Reuters 21578 数据集上使用 mahout 的错误聚类结果
【发布时间】:2012-08-27 01:29:42
【问题描述】:

我使用了 reuters 21578 数据集的一部分和 mahout k-means 进行聚类。更具体地说,我只提取了对类别“主题”具有唯一值的文本。所以我留下了 9494 个文本属于 66 个类别之一。我已经使用 seqdirectory 从文本创建序列文件,然后使用 seq2sparse 来创建向量。然后我用余弦距离测量运行 k-means(我也尝试过 tanimoto 和 euclidean,但没有更好的运气),cd=0.1 和 k=66(与类别数相同)。因此,我尝试使用自定义 Java 代码和剪影的 matlab 实现(只是为了确保我的代码中没有错误)使用 silhouette measure 评估结果,我得到聚类的平均剪影是 0.0405 。知道最好的聚类可以给出接近 1 的平均轮廓值,我发现我得到的聚类结果一点都不好。 那么这是因为 Mahout 还是路透社数据集上的分类质量低?

PS:我正在使用 Mahout 0.7

PS2:对不起我的英语不好..

【问题讨论】:

    标签: mahout


    【解决方案1】:

    我从来没有真正使用过 Mahout,所以我不能说它默认做什么,但你可以考虑检查它默认使用的距离度量。例如,如果度量标准是未归一化文档字数的欧几里德距离,您可以预期质量非常差的集群质量,因为文档长度将主导文档之间的任何有意义的比较。另一方面,规范化的余弦距离或 tf-idf 加权字数可以做得更好。

    另一件值得关注的事情是 Reuters 21578 中的主题分布。它非常偏向于少数主题,例如“acq”或“earn”,而其他主题只使用了少数几次。这可能很难实现良好的外部聚类指标。

    【讨论】:

      猜你喜欢
      • 2015-12-15
      • 2018-05-09
      • 2011-08-31
      • 1970-01-01
      • 2012-06-06
      • 2013-02-22
      • 2017-05-08
      • 2011-04-26
      • 1970-01-01
      相关资源
      最近更新 更多