【发布时间】:2019-05-02 11:10:59
【问题描述】:
据我了解,批量(普通)梯度下降会对所有训练数据进行一次参数更新。随机梯度下降 (SGD) 允许您更新每个训练样本的参数,帮助模型更快地收敛,但代价是函数损失的高波动。
批量(普通)梯度下降集batch_size=corpus_size。
SGD 设置batch_size=1。
而小批量梯度下降集batch_size=k,其中k通常为32、64、128...
gensim 如何应用 SGD 或小批量梯度下降?似乎batch_words 相当于batch_size,但我想确定一下。
在gensim模型中设置batch_words=1是否等同于应用SGD?
【问题讨论】:
标签: nlp gensim word2vec gradient-descent stochastic