【发布时间】:2017-07-28 02:51:57
【问题描述】:
spark 从 hbase 读取数据,如 //创建rdd
val hBaseRDD = sc.newAPIHadoopRDD(conf, classOf[TableInputFormat],
classOf[org.apache.hadoop.hbase.io.ImmutableBytesWritable],
classOf[org.apache.hadoop.hbase.client.Result])
例如,hBaseRDD 有 5 个分区,现在 worker 上的 executor 获取分区数据进行计算,他们必须从远程驱动程序获取数据? (不像从hdfs读取,作为hadoop slave的每个worker都有hdfs文件复制)
【问题讨论】:
标签: hadoop apache-spark hbase