【发布时间】:2017-05-20 12:58:44
【问题描述】:
我有一组简短的文档(每个 1 或 2 段)。我使用了三种不同的文档相似性方法: - tfidf 矩阵上的简单余弦相似度 - 在整个语料库上应用 LDA,然后使用 LDA 模型为每个文档创建向量,然后我应用余弦相似度。 - 在整个语料库上应用 LSA,然后使用 LSA 模型为每个文档创建向量,然后我应用余弦相似度。
根据实验,我在没有任何 LDA 或 LSA 的 tfidf 矩阵上的简单余弦相似度上获得了更好的结果。根据我阅读的内容,LDA 或 LSA 应该会改善结果,但就我而言并非如此! 知道为什么 LDA 或 LSA 的结果更差吗? LDA 和 LSA 在训练超过 1000 轮后发现某些文档之间的相似性概率高于 90%,而这些文档完全不相关!
这有什么理由吗?
谢谢
【问题讨论】:
标签: text similarity lda trigonometry lsa