【发布时间】:2018-01-30 17:32:41
【问题描述】:
我有一个 rdd,其中的元素是字典。这个字典中的值是一个列表。在此列表中,有 4 个元素。假设列表如下,[1,2,3, No] 或 [3,5,7, Yes] 我想过滤所有那些没有的元素并将它们保存在一个文本文件中,而所有的元素都保存在另一个文本文件中。 rdd 涉及大量处理才能达到这个是/否分类。如果我使用两个 rdd.filter().saveastextFile,是否需要两倍的时间?怎样才能做到最好
【问题讨论】:
标签: apache-spark pyspark