【问题标题】:Using Lucene / Mahout to find defining terms in predefined document groups使用 Lucene / Mahout 在预定义的文档组中查找定义术语
【发布时间】:2012-03-26 08:15:10
【问题描述】:

我有一组文档,分为好类和坏类。我希望能够预测新文档将属于哪个类别。我正在研究的一件事是找到最能定义每个类别的术语并在新文档中查找这些术语。

不久前,当我了解 TF-IDF 时,我正在使用 Lucene 术语向量进行 Mahout 聚类。在我看来,我正在寻找的是类似的东西,我会从一个类别中找到 TermFrequency,然后在另一个类别中应用这些术语的 InverseDocumentFrequency。

有没有人知道最好的方法来找到可以唯一定义其中一个组中的文档而不是另一个组中的文档的术语?

【问题讨论】:

    标签: lucene machine-learning classification mahout tf-idf


    【解决方案1】:

    我的建议是使用 Mahout 的 Bayesian classifier。您将文档标记为“好”或“坏”,然后 Mahout 将能够预测未经训练的文档的标签。贝叶斯分类器上的维基百科has more

    Lucene 数据可以用作 mahout 的输入,参见例如this blog post series.

    【讨论】:

      【解决方案2】:

      在与此类似的情况下,通常会使用不同条件概率的比率。

      所以你的情况是:

      P(w|好) / P(w)

      然后按此排名。

      估计只是计数中的最大可能性:

      P(w|好) = n(w,好) / n(好)

      P(w) = n(w) / N = n(w) / (n(好) + n(坏))

      N 是整体语料库标记数,n(*) 是有限制的标记数。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2015-07-23
        • 1970-01-01
        • 1970-01-01
        • 2014-02-27
        • 2018-04-29
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多