【发布时间】:2016-01-09 13:23:32
【问题描述】:
我对此进行了大量研究,但仍然找不到解决方案。
我从一个德国 Facebook 群组中提取了数据,看起来像
from_ID from_name message created_time
12334543 Max Muster Dies war auch eine sehr sch<U+00F6>ne Bucht 2016-01-08T19:00:54+0000
我明白<U+00F6>
代表德语 Umlat ö。还有许多其他 Unicode 示例替代德语变音符号或其他语言特定符号(无论哪种语言)。
无论我是想进行情绪分析还是只制作一个 wordcloud,我有时都会遇到问题。在情绪的情况下,问题是训练数据不包含这些 Unicode,因此预测/分类出错。在其他基于文本的程序的情况下,像删除停用词这样的文本清理是一个问题,因为停用词列表也是“干净的”并且不包含这些代码。
有什么简单的方法可以摆脱这种情况,让 R 显示相应的符号而不是代码?
我尝试了很多。我最后的手段是 gsub 例程。但是我的数据框包含超过 100 万个 cmets。此外 gsub 会非常痛苦,因为似乎有太多的 Unicode(如果我们想到的语言比德语多)。
如果我做对了,我使用什么样的电脑也很重要。它是 MacBook Pro。
真的非常感谢这里的任何帮助!
非常感谢您的宝贵时间和帮助!
【问题讨论】:
标签: r facebook text unicode tm