【发布时间】:2019-11-25 05:36:07
【问题描述】:
我正在研究 NLP 预处理。在某些时候,我想实现一个上下文相关的词嵌入,作为一种辨别词义的方式,我正在考虑使用 BERT 的输出来做到这一点。我注意到 BERT 使用 WordPiece 标记化(例如,“playing”->“play”+“##ing”)。
现在,我使用标准标记器对文本进行了预处理,该标记器在空格/一些标点符号上进行拆分,然后我有一个词形还原器(“正在播放”->“播放”)。我想知道 WordPiece 标记化比标准标记化 + 词形还原有什么好处。我知道 WordPiece 可以帮助解决词汇量不足的问题,但还有什么别的吗?也就是说,即使我最终没有使用 BERT,我是否应该考虑用 wordpiece 标记化替换我的标记器 + 词形还原器?在什么情况下会有用?
【问题讨论】:
标签: nlp tokenize lemmatization