【发布时间】:2019-11-24 15:45:10
【问题描述】:
关键是我试图从我的文本语料库中删除一些奇怪的词(如<U+0001F399><U+FE0F>)来做一些推特分析。
有很多这样的词我无法使用<- tm_map(X, removeWords).删除
我有大量的推文汇总在一个数据集中。然后我使用以下代码:
corpus_tweets <- tm_map (corpus_tweets, removeWords, c("<U+0001F339>", "<U+0001F4CD>"))
如果我尝试将这些奇怪的词更改为也出现在我的数据集上的常规词(例如“生命”或“动物”),那么常规词很容易被删除。
知道如何解决这个问题吗?
【问题讨论】:
标签: r text twitter sentiment-analysis word