【发布时间】:2021-11-28 15:48:40
【问题描述】:
我想在标记化后使用 spaCy 删除停用词。但是,给我一个错误,错误是AttributeError: 'str' object has no attribute 'is_stop' 我想要做的数据是标记化过程之后的数据,它位于名为“tokenizing”的列中
如何解决?
import pandas as pd
from spacy.lang.id import Indonesian
nlp = Indonesian()
data = [
'Aku suka sekali beradai di wilayah yang dingin',
'Kembali jika terjadi sesuatu di sana',
'Sampai berapa lama kamu akan pergi dari sini',
]
df = pd.DataFrame({'text': data})
df['text'] = df['text'].str.lower()
df.head()
#Tokenizing
def tokenize(word):
return [token.text for token in nlp(word)]
df['tokenizing'] = df['text'].apply(tokenize)
df.head()
#Remove stopwords
def stopwords_remover(words):
return [stopwords for stopwords in words if not stopwords.is_stop]
df['stopwords'] = df['tokenizing'].apply(stopwords_remover)
df
【问题讨论】: