【发布时间】:2017-04-26 19:26:16
【问题描述】:
我目前有这样一句话:
text = "This is a car."
然后我使用分词器,然后像这样停止它:
ps = PorterStemmer()
text = word_tokenize(text)
stemmed_words = []
for w in words:
stemmed_words.append(ps.stem(w))
但是,我现在希望使用 NLTK 的 lemmainser 来代替。要使用它,我需要像这样(在循环内)给它这个词的词性:
lemmatizer = WordNetLemmatizer()
word = lemmatizer.lemmatize(w, pos=pos)
但是,我不确定如何获取 pos 参数。我知道我可以用它来获得演讲的一部分,但这不被接受为论据:
pos = nltk.pos_tag(text)
【问题讨论】:
-
WordNetLemmatizer不需要第二个参数。大多数情况下,仅使用您尝试进行词形还原的单词就可以很好地工作。 -
@DYZ 我明白这一点,但我希望使用它会改进它。
-
那么你的答案已经在这里得到了部分回答:stackoverflow.com/questions/15586721/…
标签: python text nltk text-processing