【发布时间】:2017-04-26 10:15:58
【问题描述】:
我正在尝试将预训练的 Google 新闻 word2vec 模型调整到我的特定领域。对于我正在研究的领域,已知某些单词彼此相似,因此在理想世界中,这些单词的 Word2Vec 表示应该代表这一点。我知道我可以在特定领域数据的语料库上训练预训练模型来更新向量。
但是,如果我确定某些单词高度相似并且应该放在一起,我有没有办法将该约束合并到 word2vec 模型中?从数学上讲,我想在 word2vec 的损失函数中添加一个术语,如果我知道相似的两个在向量空间中没有彼此靠近,则会提供惩罚。有人对如何实施这个有建议吗?这是否需要我解压缩 word2vec 模型,或者有没有办法让我有可能将该附加项添加到损失函数中?
【问题讨论】:
标签: nlp stanford-nlp word2vec