【发布时间】:2016-02-10 00:54:55
【问题描述】:
pyspark 新手 -- 我有一堆文本文档,我想从这些文本文档中获取所有单个单词。
我可以看到这一步将每个文档变成了单词列表:
words = documents.map(lambda v: re.split('[\W_\']+',v.lower()))
display(words.toDF())
但我也想从中删除停用词(在此代码之前某处定义的单词列表)。问题是RDD“单词”似乎不仅仅是单词列表。它是单词列表的列表。 例如,words.first() 将返回一个单词列表,而不仅仅是一个单词。那么如何从“words”中删除任何属于停用词的单词呢?
我尝试words2 = words.map(lambda x:x if x not in stoplist) 并得到错误“org.apache.spark.SparkException: Job aborted due to stage failure:”
【问题讨论】:
标签: python apache-spark pyspark