【发布时间】:2016-03-26 01:33:30
【问题描述】:
我有一个文件“check_text.txt”,其中包含“said say says make made”。我想对其进行词干提取以获得“say say say make make”。我尝试在tm 包中使用stemDocument,如下所示,但只得到“说说制造”。有没有办法对过去时词进行词干提取?在现实世界的自然语言处理中是否有必要这样做?谢谢!
filename = 'check_text.txt'
con <- file(filename, "rb")
text_data <- readLines(con,skipNul = TRUE)
close(con)
text_VS <- VectorSource(text_data)
text_corpus <- VCorpus(text_VS)
text_corpus <- tm_map(text_corpus, stemDocument, language = "english")
as.data.frame(text_corpus)$text
编辑:我也在SnowballC包中尝试了wordStem
> library(SnowballC)
> wordStem(c("said", "say", "says", "make", "made"))
[1] "said" "sai" "sai" "make" "made"
【问题讨论】:
标签: r nlp tm stemming snowball