【发布时间】:2020-12-08 11:52:07
【问题描述】:
使用 Gensim,我经常使用三个功能,例如这个:
model = gensim.models.Word2Vec(corpus,size=100,min_count=5)
gensim 的输出,但我不明白如何在等效的 SciSpacy 命令中设置 size 和 min_count 参数:
model = spacy.load('en_core_web_md')
(输出是一个嵌入模型(太大,无法在此处添加))。
这是我经常使用的另一个命令:
model.most_similar(positive=['car'])
这是 gensim 的输出/SciSpacy 的预期输出:
[('vehicle', 0.7857330441474915),
('motorbike', 0.7572781443595886),
('train', 0.7457204461097717),
('honda', 0.7383008003234863),
('volkswagen', 0.7298516035079956),
('mini', 0.7158907651901245),
('drive', 0.7093928456306458),
('driving', 0.7084407806396484),
('road', 0.7001082897186279),
('traffic', 0.6991947889328003)]
这是我经常使用的第三条命令:
print(model.wv['car'])
Gensim 的输出/SciSpacy 的预期输出(实际上这个向量的长度为 100):
[ 1.0942473 2.5680697 -0.43163642 -1.171171 1.8553845 -0.3164575
1.3645878 -0.5003705 2.912658 3.099512 2.0184739 -1.2413547
0.9156444 -0.08406237 -2.2248871 2.0038593 0.8751471 0.8953876
0.2207374 -0.157277 -1.4984075 0.49289042 -0.01171476 -0.57937795...]
有人能告诉我 SciSpacy 的等效命令吗?例如,对于“gensim.models.Word2Vec”,我找不到如何指定向量的长度(大小参数),或者单词应该在 SciSpacy 的语料库中出现的最小次数(min_count)(例如 I看了here 和here),但我不确定我是否错过了它们?
【问题讨论】:
-
预期输出?
-
抱歉,我可以添加它们,谢谢(将尝试缩短,因为它们的预期输出只是数字向量,即单词的嵌入)