【发布时间】:2016-07-17 16:23:56
【问题描述】:
例如在 Spark 中创建某个 RDD 时:
lines = sc.textFile("README.md")
然后在这个 RDD 上调用一个转换:
pythonLines = lines.filter(lambda line: "Python" in line)
如果您在这个转换后的过滤器 RDD 上调用一个操作(例如 pythonlines.first),当他们说 an RDD will be recomputed ones again each time you run an action on them 时是什么意思?我认为在您对原始 RDD 调用 filter 转换后,您使用 textFile 方法创建的原始 RDD 不会保留。那么它会重新计算最近转换的 RDD,在这种情况下,它是我使用过滤器转换生成的 RDD?如果我的假设是正确的,我真的不明白为什么有必要这样做?
【问题讨论】:
标签: hadoop apache-spark rdd bigdata