【发布时间】:2016-07-31 17:43:48
【问题描述】:
关于 Spark RDD 有几个问题。有人可以请教我。
-
我可以看到 RDD 分布在节点之间,这是否意味着 分布式RDD缓存在每个节点的内存中,或者将RDD数据 驻留在 hdfs 磁盘上。或者只有当任何应用程序运行 RDD 数据时才能获取 缓存在内存中?
我的理解是,当我基于存在的文件创建 RDD 时 在 hdfs 块上,RDD 将第一次从 块,然后持久地缓存它。至少有一次 从磁盘读取数据,是这样吗???
如果我可以将外部数据直接缓存到 RDD 中,有什么办法吗? 首先将数据存储在 hdfs 中,然后从 hdfs 块加载到 RDD 中? 这里的目的是先将数据存储到 hdfs 中,然后将其加载到 在内存中会出现延迟??
【问题讨论】:
标签: apache-spark rdd