【发布时间】:2020-01-02 22:05:08
【问题描述】:
我正在尝试对包含 2000 多行关键字的列表进行文本分析,但它们的列出方式类似于
“战略;管理风格;组织”
所以当我使用 tm 删除标点符号时,它变成了
“策略管理样式组织”
我认为这会在某种程度上破坏我的常用术语分析。
我试过用
vector<-gsub(';', " ",vector)
但这需要我的矢量数据“2000 年列表”并使其成为一个值,当我检查这个值时,它的描述为“大字符(3 个元素)”,它给了我一个非常长的单词和内容列表装载!任何想法我做错了什么?
我应该在我的向量上还是在我的语料库上使用 gsub?他们只是
vector<-VectorSource(dataset$Keywords)
corpus<-VCorpus(vector)
我尝试过使用
inspect(corpus[[1]])
在我的语料库中使用 gsub 使其成为一个值后,但我收到错误“没有适用于 'inspect' 的方法应用于类“字符”的对象”
【问题讨论】:
-
你想要一个字符串向量列表吗?
-
我想要一个向量把它做成语料库,然后用它来预测哪些关键词属于哪个研究领域(比如数学)
-
typeof(vector) 和 typeof(vector[[1]]) 的输出是什么
-
[1] 两个输入的“字符”
-
stringr::str_split(vector, ";") 将其作为字符串列表返回,或者 unlist(stringr::str_split(vector, ";")) 将其作为向量返回。
标签: r