【问题标题】:Word not in vocabulary of GoogleNews-vectors-negative300.bin不在 GoogleNews-vectors-negative300.bin 词汇表中的词
【发布时间】:2020-04-24 07:49:32
【问题描述】:

我正在尝试查看哪些预训练模型包含新闻中的常用短语,我认为 GoogleNews-vectors-negative300.bin 应该是一个全面的模型,但结果它甚至不包括 deep_learning、machine_learning、social_network、社会责任感。什么预训练模型可以包含新闻、公共报道中经常出现的那些词?

import gensim

# Load Google's pre-trained Word2Vec model.
model = gensim.models.KeyedVectors.load_word2vec_format('GoogleNews-vectors-negative300.bin.gz', binary=True)

model.similarity('deep_learning', 'machine_learning')

【问题讨论】:

    标签: python nlp gensim word2vec


    【解决方案1】:

    这些是不太可能包含在内的 MWE(多词表达)。理论上,您可以通过对构成 MWE 的每个单词获得的向量进行平均来对它们进行建模。

    适用于包含向量的操作的不同注意事项和获得的结果是:word2vec - what is best? add, concatenate or average word vectors?

    【讨论】:

      【解决方案2】:

      GoogleNews 向量由 Google 于 2012 年至 2013 年在大型内部新闻文章语料库上进行训练。

      此外,将单个单词提升为多单词短语似乎是使用纯统计共现分析完成的(类似于 gensim Phrases 类实现的分析) - 所以通常不会匹配人类 -对实体/概念的感知水平,缺少某些单词组合,过度组合其他单词。

      因此,当时晦涩难懂(甚至还没有创造出来!)或新闻文章中很少涉及的概念将会丢失或代表性不足。

      根据您自己感兴趣的领域的文本训练您自己的向量通常是最好的方法,既可以覆盖,又可以确保向量反映文本中占主导地位的词/短语意义,而不是一般新闻或参考资料。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2018-03-08
        • 1970-01-01
        • 2016-03-02
        • 1970-01-01
        • 2020-06-04
        • 2016-05-09
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多