【发布时间】:2016-11-06 01:49:54
【问题描述】:
我急需。我有一个已转换为通用语言的语料库,但有些单词没有正确转换为英语。因此,我的语料库有非ASCII字符,例如U+00F8。
我正在使用 Quanteda,并且我已经使用以下代码导入了我的文本:
EUCorpus <- corpus(textfile(file="/Users/RiohBurke/Documents/RStudio/PROJECT/*.txt"), encodingFrom = "UTF-8-BOM")
我的语料库包含 166 个文档。将文档导入 R 后,摆脱这些非 ASCII 字符的最佳方法是什么?
【问题讨论】:
-
你可以用 iconv 做到这一点。有关详细信息,请参阅此答案:stackoverflow.com/a/9935242/5151349