【发布时间】:2019-10-03 07:48:31
【问题描述】:
我已经加载了一个文本文件并应用了转换(过滤器)但没有得到预期的结果。代码和结果低于
stopwords = ['MP','UP']
2
rdd3 = ARDD.filter(lambda x: x not in stopwords)
3
rdd3.take(10)
(2) Spark Jobs
Out[22]: ['MP , rajasthan, UP , Kashmir , delhi , haryana , punjab ']
【问题讨论】:
-
如果您在 pyspark 中工作,那么您为什么使用 RDD 而不是 DataFrame??
-
@AtlasBravoos 我在 dataframe 中使用过 pyspark 。所以我正在尝试使用 RDD 。是这个问题的原因吗?
-
什么是 ARDD?请详细说明
-
@PrathikKini 我刚刚命名了一个 RDD ARDD
标签: apache-spark pyspark jupyter-notebook rdd