推荐一篇文章: https://www.jianshu.com/p/da235893e4a5

Word2Vec模型中,主要有Skip-Gram和CBOW两种模型,从直观上理解,Skip-Gram是给定input word来预测上下文。而CBOW是给定上下文,来预测input word。本篇文章仅讲解Skip-Gram模型。

skip-gram的理解

对于skip-gram,它的训练方式大致是这样的:输入的是一个词的one-hot编码,这个编码是相当稀疏的,所以当这个one-hot与权重w相乘之后,就会有一个类似于lookup表的作用(降维),然后用它去训练神经网络,隐层的输出就是各个词的词向量,然后在输出层用softmax函数来产生一个概率分布,也就是该词的窗口C内的上下文的词各种取值的概率,取概率最大的那个词作为当前词。

这个skip-gram和cbow的有用的就在于隐层输出的词向量,因为我们要的就是词向量,而最后的输出层的用处是为了训练调参,当误差最小的时候,隐层的输出就是表示的最好的词向量

相关文章:

  • 2021-07-24
  • 2021-10-01
  • 2021-05-17
  • 2021-05-31
  • 2022-12-23
  • 2021-04-12
  • 2021-08-16
猜你喜欢
  • 2021-04-13
  • 2021-12-12
  • 2021-12-03
  • 2021-09-08
  • 2021-10-28
  • 2021-06-09
  • 2021-06-16
相关资源
相似解决方案