【问题标题】:BERT training with character embeddings使用字符嵌入进行 BERT 训练
【发布时间】:2020-07-11 12:43:33
【问题描述】:

将 BERT 模型中的标记化范式更改为其他内容是否有意义?也许只是一个简单的单词标记化或字符级标记化?

【问题讨论】:

    标签: nlp pytorch tokenize transformer


    【解决方案1】:

    这是论文“CharacterBERT: Reconciling ELMo and BERT for Word-Level Open-Vocabulary Representations From Characters”背后的一个动机,其中 BERT 的文字系统被丢弃并替换为 CharacterCNN(就像在 ELMo 中一样)。这样,可以使用词级标记化而不会出现任何 OOV 问题(因为模型会处理每个标记的字符),并且模型会为任意输入标记生成单个嵌入。

    在性能方面,该论文表明 CharacterBERT 通常至少与 BERT 一样好,同时对嘈杂的文本更稳健。

    【讨论】:

      【解决方案2】:

      这取决于你的目标是什么。使用标准词标记当然可以,但是很多词最终会超出词汇表,从而导致模型表现不佳。

      从研究的角度来看,完全在字符级别工作可能会很有趣:了解如何建模将学会自行分割文本,以及与标准标记化相比,这样的分割看起来如何。我不确定它是否对实际使用有好处。字符序列比子词序列长得多,而且 BERT 需要序列长度的二次记忆,它只会不必要地减慢训练和推理速度。

      【讨论】:

        猜你喜欢
        • 2020-12-08
        • 2020-02-29
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2023-03-12
        • 2021-05-13
        • 1970-01-01
        • 2022-11-08
        相关资源
        最近更新 更多