【问题标题】:Subword vectors to a word vector tokenized by Sentencepiece子词向量到由 Sentencepiece 标记的词向量
【发布时间】:2020-06-28 10:46:37
【问题描述】:

有一些嵌入模型使用 Sentencepiece 模型进行标记化。因此,他们为不在词汇表中的未知单词提供子词向量。但我想为每个单词获取单词向量,例如 Word2vec、fastText。 我应该平均子词向量来表示一个词向量吗?

【问题讨论】:

  • 你为什么对那些词向量感兴趣?如果我们知道您最终想要做什么,这有助于回答您的问题。您可以相应地编辑您的问题吗?

标签: nlp word-embedding


【解决方案1】:
  • 我在类似的行上做了一些实验,平均所有子词 嵌入与整体的同义词具有更好的余弦相似性 词。

  • 所以是的平均是有意义的,最好的选择,像 单词和句子

【讨论】:

  • 非常感谢您分享有关此主题的知识。在对“余弦相似度”和“Keras 嵌入层”进行平均之前,我应该对这些子词向量进行归一化吗?
  • 不需要,因为子词的嵌入来自相同的层,所以均值和方差的差异很小。所以一个简单的平均值应该可以完成这项工作。
  • 谢谢@Hari Prasad
猜你喜欢
  • 1970-01-01
  • 2018-05-16
  • 2016-08-12
  • 1970-01-01
  • 2020-12-12
  • 1970-01-01
  • 1970-01-01
  • 2021-02-20
  • 1970-01-01
相关资源
最近更新 更多