【发布时间】:2018-06-14 11:50:08
【问题描述】:
我的问题基本上如下。我有一个 pandas 数据框,其中有一列包含相当大量的文本(通常为 20 到 200 个单词)。这个数据框大约有 600k 行。最重要的是,我有一个单词列表,大约有 150k 项长,需要从数据框中的字符串中过滤掉。我目前正在使用这种方法来做到这一点:
for word in uncommon_words:
reports['Report_Clean_Filtered'] = reports['Report_Clean'].str.replace(word, '')
其中 uncommon_words 是单词列表,reports 是数据框。
我估计这在我的机器上大约需要 27 小时。有没有更好(或至少更快)的方法来做到这一点?我有一个非常开放的心态! :)
【问题讨论】:
标签: python performance list pandas nlp