【问题标题】:Python Pandas NLTK How to Apply Port Stemmer to Dataframe Column That has Been Tokenized AlreadyPython Pandas NLTK 如何将 Port Stemmer 应用于已经标记化的数据框列
【发布时间】:2018-11-28 20:57:12
【问题描述】:

我有以下示例数据集:

No  category    problem_definition
175 2521        ['coffee', 'maker', 'brewing', 'properly', '420']
211 1438        ['galley', 'work', 'table', 'stuck']
912 2698        ['cloth', 'floor', 'coming', 'aft']
572 2521        ['compartment', 'door', 'stuck']

problem_definition 字段已经经过停用词删除和标记化。现在我正在尝试将 Port Stemmer 应用于 problem_definition 列。

我尝试了以下代码:

from nltk.stem import PorterStemmer

ps = PorterStemmer()

df['problem_definition_stemmed'] = df['problem_definition_stopwords'].apply(lambda x : [PorterStemmer.stem(y) for y in x])

我收到以下错误:

TypeError: 'PorterStemmer' object is not callable

【问题讨论】:

    标签: python pandas nltk stemming


    【解决方案1】:

    PosrterStemmer 是一个类构造函数。它没有方法.stem。实际的词干分析器是psPorterStemmer.stem(y) 必须是 ps.stem(y)

    【讨论】:

      猜你喜欢
      • 2018-06-30
      • 2022-12-21
      • 2016-06-04
      • 1970-01-01
      • 2021-12-18
      • 2012-10-31
      相关资源
      最近更新 更多