【发布时间】:2019-06-15 23:33:06
【问题描述】:
问题有两个方面:
1.如何为size选择理想值?
2.如何动态获取词汇量(按我的意图每行)以设置理想的大小?
我的数据如下所示(示例)——只有一行和一列:
第 1 行
{kfhahf}
Lfhslnf;
.
.
.
第 2 行
(stdgff ksshu, hsihf)
asgasf;
.
.
.
等等
基于这篇文章:Python: What is the "size" parameter in Gensim Word2vec model class size 参数应该小于(或等于?)词汇量大小。所以,我试图动态分配大小如下:
from nltk.tokenize import word_tokenize
from gensim.models import Word2Vec
# I do Word2Vec for each row
For item in dataset:
Tokenized = word_tokenize(item)
model = Word2Vec([Tokenized], min_count=1)
我在这里得到了词汇量。所以我创建了第二个模型:
model1 = Word2Vec([Tokenized], min_count=1, size=len(model.wv.vocab))
这将size 值设置为当前行的当前词汇值,正如我所期望的那样。但这是正确的做法吗?小词汇量文本的合适大小是多少?
【问题讨论】:
标签: python python-3.x nltk gensim word2vec