【发布时间】:2019-05-10 22:34:31
【问题描述】:
这是我的代码
CSV 文件的网址:https://github.com/eugeneketeni/web-mining-final-project/blob/master/Test_file.csv
import pandas as pd
data = pd.read_csv("https://raw.githubusercontent.com/eugeneketeni/web-
mining-final-project/master/Test_file.csv")
import nltk
from nltk import word_tokenize, sent_tokenize
data['text'] = data.loc[:, 'text'].astype(str)
text = data.loc[:, "text"].astype(str)
tokenizer = [word_tokenize(text[i]) for i in range(len(text))]
print(tokenizer)
filtered_sentence = []
from nltk.corpus import stopwords
stopwords = set(stopwords.words('english'))
filtered_sentence = [w for w in tokenizer if not w in stopwords]
print(filtered_sentence)
我的标记器可以工作,但是当我尝试删除默认停用词时,我不断收到“unhashable type: 'list'”错误。我不确定到底发生了什么。我将不胜感激任何帮助。谢谢。
【问题讨论】:
-
你能发布什么是分词器或类型吗?我相信它一定是一个字符串列表。
-
type(tokenizer) 是一个列表
-
分词器的元素有哪些类型?
标签: python pandas nltk data-analysis stop-words