【发布时间】:2019-06-06 16:09:49
【问题描述】:
我们有人类之间的对话历史(任何语言,任何词汇),所以有很多拼写错误:
"hellobb do u hav skip?" => "hello baby, do you have skype?"
在针对该数据集运行深度学习任务(查找同义词等)之前,我想修复这些错误。
这是个好主意吗?我从来没有处理过质量如此差的数据。想知道是否有“神奇的解决方案”来实现这一目标。
其他我打算使用:
- 词嵌入 (word2vec) 检查好词和坏词是否相似
- 单词之间的距离函数
- 如果 wordA 不太知名 wordB 然后 fix(wordA) = wordB
【问题讨论】:
标签: deep-learning nlp nltk text-mining