【发布时间】:2015-07-31 18:18:06
【问题描述】:
所以,我想将 RDD 读入一个数组。为此,我可以使用 collect 方法。但是这种方法真的很烦人,因为在我的情况下它不断给出 kyro 缓冲区溢出错误。如果我将 kyro 缓冲区大小设置得太大,它就会开始出现问题。另一方面,我注意到如果我只是使用 saveAsTextFile 方法将 RDD 保存到文件中,我不会收到任何错误。所以,我在想,一定有更好的方法将 RDD 读入数组,它不像 collect 方法那样有问题。
【问题讨论】:
-
也许最好问一个关于缓冲区溢出错误的问题。
-
我可以设置的 Kyro Serializer 缓冲区的最大大小为 1GB。那么,这是否意味着我不能收集超过 1GB 的数据?
-
也许切换到标准序列化?
-
@maasg:你如何切换到标准序列化?
-
一个更相关的问题是 a) 为什么不能保存文件并读回文件? b) 为什么你真的希望在一个驱动程序中拥有 >1G 的数据?
标签: java serialization apache-spark bigdata