【发布时间】:2016-09-25 01:18:54
【问题描述】:
我一直在尝试从我使用 python 代码读取的 csv 文件中删除停用词,但我的代码似乎不起作用。我尝试在代码中使用示例文本来验证我的代码,但它仍然是相同的。下面是我的代码,如果有人能帮我纠正这个问题,我将不胜感激。这是下面的代码
import nltk
from nltk.tokenize import word_tokenize
from nltk.corpus import stopwords
import csv
article = ['The computer code has a little bug' ,
'im learning python' ,
'thanks for helping me' ,
'this is trouble' ,
'this is a sample sentence'
'cat in the hat']
tokenized_models = [word_tokenize(str(i)) for i in article]
stopset = set(stopwords.words('english'))
stop_models = [i for i in tokenized_models if str(i).lower() not in stopset]
print('token:'+str(stop_models))
【问题讨论】:
-
作为一般建议,简单地打印出当前行之间的值以查看发送到每个后续行的内容很有用。
-
谢谢,我试过了,没有任何运气!!
标签: python python-3.x nltk stop-words