【问题标题】:Why the code I used to load pre-trained word2vec from google news corpus (English) is not working to load the google news corpus (Indonesian)?为什么我用来从谷歌新闻语料库(英语)加载预训练 word2vec 的代码无法加载谷歌新闻语料库(印度尼西亚语)?
【发布时间】:2018-11-06 22:18:49
【问题描述】:

我正在参与一项涉及英语和印度尼西亚语参与者的跨文化语言研究。

在英语参与者中,我成功地从谷歌新闻语料库(文件:GoogleNews-vectors-negative300.bin)加载了预训练好的word2vec。

我想知道,因为我无法加载印度尼西亚语的谷歌新闻语料库。 (文件:id.bin,文件来源:https://github.com/Kyubyong/wordvectors)。

这是工作代码:

import gensim
from gensim import models
from gensim.models import Word2Vec
import math
import sys
import warnings
warnings.filterwarnings(action='ignore', category=UserWarning, module='gensim')

model = gensim.models.word2vec.Word2Vec.load_word2vec_format('GoogleNews-vectors-negative300.bin', binary=True)

这是不工作的代码:

import gensim
from gensim import models
from gensim.models import Word2Vec
import math
import sys
import warnings
warnings.filterwarnings(action='ignore', category=UserWarning, module='gensim')

model = gensim.models.word2vec.Word2Vec.load_word2vec_format('id.bin', binary=True)

这样做的正确方法是什么?

【问题讨论】:

    标签: python anaconda pre-trained-model


    【解决方案1】:

    您应该使用load() 而不是load_word2vec_format()load_word2vec_format是google生成的模型,不是gensim生成的模型。

    import gensim
    
    model = gensim.models.word2vec.Word2Vec.load('id.bin')
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2020-05-12
      • 2022-01-24
      • 2021-10-22
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多