【发布时间】:2018-04-22 05:18:53
【问题描述】:
我正在尝试使用 gensim 库在 5000 万个可变长度的句子上训练一个 doc2vec 模型。
一些教程(例如https://github.com/RaRe-Technologies/gensim/blob/develop/docs/notebooks/doc2vec-lee.ipynb)在实际训练过程之前有一个model.build_vocab 步骤。这部分已经运行了 3 个小时,没有任何更新。
这个步骤对于训练过程是必要的吗?为什么这一步需要这么长时间,因为它只是对数据的线性传递?
在 python 3.6.0 中使用 gensim 3.4.0 版
【问题讨论】:
-
试试
progress_per参数
标签: python-3.x nlp word2vec gensim