【发布时间】:2016-09-27 05:10:27
【问题描述】:
我想知道如何在包含地图的工人上创建 RDD。这个 Map/RDD 会很小,我希望这个 RDD 完全驻留在一台机器/执行器上(我猜 repartition(1) 可以实现这一点)。此外,我希望能够在本地执行器上缓存此 Map/RDD,并在此执行器上运行的任务中使用它以进行查找。
我该怎么做?
【问题讨论】:
-
您不会发现任何简单/漂亮的方法可以做到这一点。这不是 Spark 擅长的领域。进行本地查找等。
标签: apache-spark rdd