【问题标题】:Wordpiece tokenization versus conventional lemmatization?Wordpiece 标记化与传统的词形还原?
【发布时间】:2019-11-25 05:36:07
【问题描述】:

我正在研究 NLP 预处理。在某些时候,我想实现一个上下文相关的词嵌入,作为一种辨别词义的方式,我正在考虑使用 BERT 的输出来做到这一点。我注意到 BERT 使用 WordPiece 标记化(例如,“playing”->“play”+“##ing”)。

现在,我使用标准标记器对文本进行了预处理,该标记器在空格/一些标点符号上进行拆分,然后我有一个词形还原器(“正在播放”->“播放”)。我想知道 WordPiece 标记化比标准标记化 + 词形还原有什么好处。我知道 WordPiece 可以帮助解决词汇量不足的问题,但还有什么别的吗?也就是说,即使我最终没有使用 BERT,我是否应该考虑用 wordpiece 标记化替换我的标记器 + 词形还原器?在什么情况下会有用?

【问题讨论】:

    标签: nlp tokenize lemmatization


    【解决方案1】:

    word-piece 标记化在多个方面都有帮助,并且应该比 lemmatizer 更好。由于多种原因:

    1. 如果你有“playful”、“playing”、“played”这些词,要词形化为“play”,它可能会丢失一些信息,例如playing是现在时,played是过去时,这在词片标记化中不会发生。
    2. 词片标记涵盖所有单词,甚至是字典中没有出现的单词。它会拆分单词,并且会有单词片段标记,这样,您将拥有分割单词片段的嵌入,这与删除单词或替换为“未知”标记不同。

    使用词片标记化而不是标记器+词形还原器只是一种设计选择,词片标记化应该表现良好。但是您可能需要考虑一下,因为词片标记化会增加标记的数量,而词形还原并非如此。

    【讨论】:

    • 感谢您的帮助。如果我要使用 TF-IDF 之类的东西运行关键术语提取步骤,那么额外的令牌是否会成为一种责任,因为现在“##ing”可能会作为关键术语出现?我的想法是运行 token+lemma,将 lemmas 通过 TF-IDF 获取关键术语,然后用 wordpiece 重新标记以嵌入 Bert。
    • 我不了解 TF-IDF,因为我从未使用过它。对此感到抱歉。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-08-07
    • 2021-10-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-11-02
    相关资源
    最近更新 更多