【问题标题】:What do the "Top Terms" actually mean in the output of mahout clusterdump?mahout clusterdump 的输出中的“热门术语”实际上是什么意思?
【发布时间】:2014-05-07 14:55:14
【问题描述】:

我是 mahout 环境的新手... 我得到以下输出

/opt/hadoop/mahout-distribution-0.9/bin$ mahout clusterdump \
>    -d /app/hadoop/dmacs/training_set1_sparseout/dictionary.file-0 \
>    -dt sequencefile \
>    -i /app/hadoop/dmacs/training_set1_sparseout/kmeans-clusters/clusters-2-final \
>    -n 20 \
>    -b 100 \
>    -o /app/hadoop/dmacs/kmeans_final_output/cdump.txt \
>    -dm org.apache.mahout.common.distance.CosineDistanceMeasure   

:VL-1480{n=150 c=[1000062,3,2005:0.098, 1000079,1,2002:0.080, 1000079,2,2002:0.078, 1000079,3,2002:0.
    Top Terms:
            25                                      =>  10.670724073251089
            31                                      =>   7.999464999039968
            1664010,5,2005                          =>  1.2396535428365072
            2439493,1,2003                          =>   1.184131249586741
            507603,1,2005                           =>  0.9944797229766845
            199257,3,2005                           =>  0.9928587055206299
            2602249,3,2004                          =>  0.9890585215886434
            184705,3,2004                           =>  0.9728035926818848
            447759,5,2005                           =>  0.9652122163772583
            1152594,3,2004                          =>  0.9619592666625977
            104237,5,2005                           =>  0.9515269517898559
            1473980,3,2005                          =>  0.9478832610448201
            2118461,4,2005                          =>  0.9315701317787171
            1037245,3,2005                          =>  0.9236405754089355
            1639792,1,2002                          =>  0.9183504740397136
            1227322,1,2003                          =>  0.9121313015619914
            2019240,3,2004                          =>   0.909924259185791
            1117152,5,2005                          =>  0.9050878302256267
            2040853,3,2004                          =>  0.9025738382339478
            1309838,5,2005                          =>  0.8964522886276245

输出中最重要的术语实际上是什么意思。 提前谢谢!!!

【问题讨论】:

  • 这似乎是一个集群转储输出?你是怎么做到的?最上面的词是指那些文档的前几个词,它们是集群的一部分。
  • 我正在使用 netflix 数据集来运行 k-means 聚类算法。现在,我想显示所有数据点,而不是只显示文档的几个术语。在 mahout clusterdump 命令中使用 -n 和 -b 究竟是什么意思。我已经编辑了我的问题,包括 mahout clusterdump 的运行命令。
  • 你想从 netflix 数据中聚类什么?
  • 我正在尝试对用户记录进行聚类,我在第二个集群中也得到了 507603,1,2005 ...,第一行 25,... 和第二行 31,是什么。 .... 表示出现在每个集群中。
  • 25 => 10.670724073251089 10.6的值是什么意思?

标签: cluster-computing mahout


【解决方案1】:

top term 表示那些文档的前几个术语,它们是集群的一部分。您可以使用-n / -- numWords 标志和clusterdump 命令来控制最重要的术语输出。

flags的详细信息可以参考帮助:

mahout-distribution-0.9$ bin/mahout clusterdump -h

也可以看看类似的问题:Interpreting output from mahout clusterdumper

【讨论】:

  • 提供的信息非常有用,解决了我的问题
猜你喜欢
  • 2018-08-08
  • 1970-01-01
  • 1970-01-01
  • 2020-02-15
  • 1970-01-01
  • 1970-01-01
  • 2019-04-23
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多