【发布时间】:2021-11-26 08:02:42
【问题描述】:
我正在尝试使用 NLTK 清理我的数据集,但我遇到了一些麻烦,因为它需要很长时间才能完成。我确实有一个非常大的数据集,包含超过 20000 多行文本。
我正在运行的代码如下所示:
from nltk.corpus import words
nltk.download('words')
gibberishBody = []
for x in bodyStopWords:
if x in words.words():
gibberishBody.append(x)
print(gibberishBody)
bodyStopWords 是 pandas.core.series.Series 数据类型。
有人对优化脚本速度有什么建议吗?
【问题讨论】:
-
请以代码sn -p @Ashish的形式添加一小部分数据
标签: python optimization nlp nltk