【发布时间】:2020-01-02 17:15:48
【问题描述】:
我正在尝试对标记化列 cmets_tokenized 进行词形还原
我愿意:
import nltk
from nltk.stem import WordNetLemmatizer
# Init the Wordnet Lemmatizer
lemmatizer = WordNetLemmatizer()
def lemmatize_text(text):
return [lemmatizer.lemmatize(w) for w in df1["comments_tokenized"]]
df1['comments_lemmatized'] = df1["comments_tokenized"].apply(lemmatize_text)
但是有
TypeError: unhashable type: 'list'
我可以做些什么来对包含词袋的列进行词形还原?
以及如何避免将 [don't] 划分为 [do,n't] 的标记化问题?
【问题讨论】:
标签: pandas nltk lemmatization