【发布时间】:2016-06-15 18:01:04
【问题描述】:
我需要使用 Spark SQL 或 Dataframe API 连接表。需要知道实现它的优化方式。
场景是:
- Hive 中的所有数据都以 ORC 格式(基本数据框和参考文件)存在。
- 我需要将从 Hive 读取的一个 Base 文件(Dataframe)与 11-13 个其他参考文件连接起来,以创建一个大的内存结构(400 列)(大约 1 TB 大小)
实现这一目标的最佳方法是什么?如果有人遇到类似问题,请分享您的经验。
【问题讨论】:
标签: apache-spark apache-spark-sql