【发布时间】:2020-01-17 12:51:22
【问题描述】:
paper describing BERT 中有一段关于 WordPiece Embeddings 的内容。
我们使用 WordPiece 嵌入(Wu 等人, 2016) 具有 30,000 个标记词汇表。首先 每个序列的标记总是一个特殊的分类 令牌([CLS])。最终隐藏状态 与此令牌对应的用作聚合 用于分类的序列表示 任务。句子对被打包成一个 单序列。我们区分句子 两种方式。首先,我们用一个特殊的 令牌([SEP])。其次,我们添加了一个学习嵌入 到每个标记,表明它是否属于 到句子 A 或句子 B。如图 1 所示, 我们将输入嵌入表示为 E,最终隐藏 特殊 [CLS] 标记的向量为 C 2 RH, 以及第 i 个输入标记的最终隐藏向量 作为Ti 2 RH。 对于给定的令牌,其输入表示为 通过对相应的令牌求和构造, 段和位置嵌入。可视化 这种结构如图 2 所示。
据我了解,WordPiece 将单词拆分为像 #I #like #swim #ing 这样的单词片段,但它不会生成嵌入。但是我在论文和其他来源中没有找到任何这些 Token Embeddings 是如何生成的。他们是否在实际预训练之前进行了预训练?如何?或者它们是随机初始化的?
【问题讨论】:
标签: machine-learning nlp word-embedding