【发布时间】:2020-07-11 12:43:33
【问题描述】:
将 BERT 模型中的标记化范式更改为其他内容是否有意义?也许只是一个简单的单词标记化或字符级标记化?
【问题讨论】:
标签: nlp pytorch tokenize transformer
将 BERT 模型中的标记化范式更改为其他内容是否有意义?也许只是一个简单的单词标记化或字符级标记化?
【问题讨论】:
标签: nlp pytorch tokenize transformer
这是论文“CharacterBERT: Reconciling ELMo and BERT for Word-Level Open-Vocabulary Representations From Characters”背后的一个动机,其中 BERT 的文字系统被丢弃并替换为 CharacterCNN(就像在 ELMo 中一样)。这样,可以使用词级标记化而不会出现任何 OOV 问题(因为模型会处理每个标记的字符),并且模型会为任意输入标记生成单个嵌入。
在性能方面,该论文表明 CharacterBERT 通常至少与 BERT 一样好,同时对嘈杂的文本更稳健。
【讨论】:
这取决于你的目标是什么。使用标准词标记当然可以,但是很多词最终会超出词汇表,从而导致模型表现不佳。
从研究的角度来看,完全在字符级别工作可能会很有趣:了解如何建模将学会自行分割文本,以及与标准标记化相比,这样的分割看起来如何。我不确定它是否对实际使用有好处。字符序列比子词序列长得多,而且 BERT 需要序列长度的二次记忆,它只会不必要地减慢训练和推理速度。
【讨论】: