【发布时间】:2021-02-15 10:08:37
【问题描述】:
我正在尝试使用 Google 的 word2vec 预训练模型来获取词嵌入。我能够在我的代码中加载模型,我可以看到我得到了一个单词的 300 维表示。这是代码-
import gensim
from gensim import models
from gensim.models import Word2Vec
model = gensim.models.KeyedVectors.load_word2vec_format('/Downloads/GoogleNews-vectors-negative300.bin', binary=True)
dog = model['dog']
print(dog.shape)
这给了我下面的输出 -
>>> print(dog.shape)
(300,)
这可行,但我有兴趣获得整个文档的矢量表示,而不仅仅是一个单词。如何使用 word2vec 模型做到这一点?
dog_sentence = model['it is a cute little dog']
KeyError: "word 'it is a cute little dog' not in vocabulary"
我计划将这些应用到许多文档上,然后针对它的主题训练一个聚类模型来进行无监督学习和主题建模。
【问题讨论】:
标签: python word2vec word-embedding