【发布时间】:2015-01-01 07:49:33
【问题描述】:
我是 R 软件的新手
现在,学习使用“tm”包进行文本挖掘
我在将文本映射为小写时遇到了问题
sms_raw<-read.csv(............)
sms_corpus<-Corpus(VectorSource(sms_raw$text))
sms_corpus<-Corpus(VectorSource(sms_raw$text))
tm_map(sms_corpus,content_transformer(tolower))
error:invalid multubytes string 1
我认为我的 csv 文件可能不是 utf-8,所以我恢复为 utf-8 但它不起作用。
我的操作系统是win8.1
谁有这个问题的解决方案,请告诉我。
【问题讨论】:
-
请提供一个可重现的小例子来说明你的进步在哪里停止。
标签: r utf-8 text-mining multibyte