【发布时间】:2017-12-24 01:17:31
【问题描述】:
我需要对葡萄牙语字符串执行词干提取。为此,我使用 nltk.word_tokenize() 函数对字符串进行标记,然后分别对每个单词进行词干处理。之后,我重建字符串。它工作正常,但表现不佳。我怎样才能让它更快?字符串长度约为200万字。
tokenAux=""
tokens = nltk.word_tokenize(portugueseString)
for token in tokens:
tokenAux = token
tokenAux = stemmer.stem(token)
textAux = textAux + " "+ tokenAux
print(textAux)
抱歉英语不好,谢谢!
【问题讨论】: