【发布时间】:2018-12-01 21:18:40
【问题描述】:
您好,我是 word2vec 的新手,所以我正在尝试一个简单的程序来读取文件并获取每个单词的 vec,但是标记化过程有问题,因为 word2vec 考虑的是每个字母而不是单词!
例如,我的文件包含“你好,这是我的第一次试用”
from gensim.models import Word2Vec
from nltk.tokenize import word_tokenize
F = open('testfile')
f=F.read()
doc= word_tokenize(f)
print(f)
print(doc)
model = Word2Vec(doc,min_count=1)
# summarize the loaded model
print(model)
words = list(model.wv.vocab)
print(model['hello'])
我收到一个错误,说 hello 不在词汇中,但是当我使用字母“h”时它可以工作
【问题讨论】:
-
doc打印什么? -
文件内容列表 ['hello', 'this','is','my','first','trial'] @ShlomiF
标签: python nlp gensim word2vec