【问题标题】:different approach for document similarity(LDA, LSA, cosine)文档相似度的不同方法(LDA、LSA、余弦)
【发布时间】:2017-05-20 12:58:44
【问题描述】:

我有一组简短的文档(每个 1 或 2 段)。我使用了三种不同的文档相似性方法: - tfidf 矩阵上的简单余弦相似度 - 在整个语料库上应用 LDA,然后使用 LDA 模型为每个文档创建向量,然后我应用余弦相似度。 - 在整个语料库上应用 LSA,然后使用 LSA 模型为每个文档创建向量,然后我应用余弦相似度。

根据实验,我在没有任何 LDA 或 LSA 的 tfidf 矩阵上的简单余弦相似度上获得了更好的结果。根据我阅读的内容,LDA 或 LSA 应该会改善结果,但就我而言并非如此! 知道为什么 LDA 或 LSA 的结果更差吗? LDA 和 LSA 在训练超过 1000 轮后发现某些文档之间的相似性概率高于 90%,而这些文档完全不相关!

这有什么理由吗?

谢谢

【问题讨论】:

    标签: text similarity lda trigonometry lsa


    【解决方案1】:

    我使用了LDA4j 实现并获得了比 TFIDF 更好的结果,同样对于 LSI,我使用了semantic-vector 实现。如果您有自己的实现,请分享模型草图。您还需要对语料库进行规范化以获得更好的结果。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-03-14
      • 2014-02-25
      • 1970-01-01
      • 2015-05-31
      • 2012-12-06
      • 2014-02-25
      • 2020-08-12
      • 2020-01-25
      相关资源
      最近更新 更多