【发布时间】:2018-02-14 14:01:02
【问题描述】:
我目前正在使用 NLTK 的 SnowballStemmer 来阻止我的文档中的单词,当我有 68 个文档时,它运行良好。现在我有 4000 个文档,这太慢了。我读了另一篇文章,有人建议使用PyStemmer,但这在 Python 3.6 上不提供。还有其他软件包可以解决问题吗?或者也许我可以在代码中做一些事情来加快这个过程。
代码:
eng_stemmer = nltk.stem.SnowballStemmer('english')
...
class StemmedCountVectorizer(CountVectorizer):
def build_analyzer(self):
analyzer = super(StemmedCountVectorizer, self).build_analyzer()
return lambda doc: ([eng_stemmer.stem(w) for w in analyzer(doc)])
【问题讨论】:
标签: python python-3.x nlp nltk stemming