【问题标题】:Finding concepts from a large corpus using Word embeddings使用 Word 嵌入从大型语料库中查找概念
【发布时间】:2017-03-22 05:25:35
【问题描述】:

我正在尝试从 Konkani 语言的语料库中找出新概念。 我在 1) 特定领域的语料库 2) 报纸语料库上训练了两个模型。

我已经使用 Gensim word2vec 来训练模型,但是我无法在向量空间中获得具有相似含义的术语。

结束词之间没有同义词的关系。它们的相似度就像一些随机词一样好。

我做错了什么?

【问题讨论】:

    标签: gensim word2vec word-embedding


    【解决方案1】:

    你的语料库有多大?

    要使经过训练的向量有意义,您至少需要 1 亿个单词语料库(假设大约 1-2 百万个唯一单词)。

    如果您使用负抽样而不是分层抽样,您可能会怀疑抽样方法,但我仍然认为语料库规模小是您的主要问题。

    【讨论】:

      猜你喜欢
      • 2019-09-30
      • 2018-12-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2012-07-02
      • 2021-06-29
      • 1970-01-01
      相关资源
      最近更新 更多