【发布时间】:2020-06-15 13:50:40
【问题描述】:
所以我正在做一个关于文档相似性的项目,现在我的功能只是来自 Doc2Vec 的嵌入。既然没有显示出任何好的结果,那么在文档嵌入之前的超参数优化和词嵌入之后......我还可以添加哪些其他功能,以获得更好的结果? 我的数据集是 150 个文档,每个文档 500-700 个单词,有 10 个主题(标签),每个文档都有一个主题。文档在文档级别进行标记,并且该标记目前仅用于评估目的。
编辑:以下是对 gojomo 问题的回答,并详细说明了我对他的回答的评论:
模型的评估是在训练集上完成的。我正在比较标签是否与模型中最相似的文档相同。为此,我首先使用模型的方法“infer_vector”获取文档向量,然后使用“most_similar”获取最相似的文档。我得到的当前结果是 40-50% 的准确率。令人满意的分数至少为 65% 及以上。
由于这项研究的目的和进一步的用例,我无法获得更大的数据集,这就是为什么我被教授推荐的原因,因为这是一个大学项目,为文档添加一些额外的功能Doc2Vec 的嵌入。由于我不知道他在说什么,所以我在询问 stackoverflow 社区。
模型的最终目标是对文档进行聚类,同样,标签现在仅用于评估目的。
如果我用这个模型没有得到好的结果,我会尝试@Adnan S @gojomo 提到的更简单的模型,例如 TF-IDF、Word Mover's Distance、Bag of words,只是假设我会得到更好的结果使用 Doc2Vec。
【问题讨论】:
标签: nlp data-science doc2vec sentence-similarity