【问题标题】:R-invalid multibyte string 1R-无效的多字节字符串 1
【发布时间】:2015-01-01 07:49:33
【问题描述】:

我是 R 软件的新手

现在,学习使用“tm”包进行文本挖掘

我在将文本映射为小写时遇到了问题

sms_raw<-read.csv(............)
sms_corpus<-Corpus(VectorSource(sms_raw$text)) 
sms_corpus<-Corpus(VectorSource(sms_raw$text))  
tm_map(sms_corpus,content_transformer(tolower))   
error:invalid multubytes string 1

我认为我的 csv 文件可能不是 utf-8,所以我恢复为 utf-8 但它不起作用。

我的操作系统是win8.1

谁有这个问题的解决方案,请告诉我。

【问题讨论】:

  • 请提供一个可重现的小例子来说明你的进步在哪里停止。

标签: r utf-8 text-mining multibyte


【解决方案1】:

我通过编码函数轻松解决的错误

在我的文件的列中,名称为文本包含多字节字符

所以我输入

sms_raw$text <- iconv(enc2utf8(sms_raw$text),sub="byte")

此命令将“文本”列(多字节)转换为 utf8 格式

【讨论】:

  • 我知道这是几年前的事了,但谢谢。解决了我的问题。
猜你喜欢
  • 1970-01-01
  • 2012-12-31
  • 1970-01-01
  • 2021-04-18
  • 1970-01-01
  • 2019-12-11
  • 1970-01-01
  • 1970-01-01
  • 2018-04-10
相关资源
最近更新 更多