【发布时间】:2018-06-04 11:12:39
【问题描述】:
我有 4 个四个 Hive 表:
A - 1.2 billion records and 250 GB
B - 4 billion records and 1 TB
C - 30 billion records and 2 TB
D - 2 billion records and 100 GB
所有表都没有分区 A 是 B 的父级(一对多外键关系),B 是 C 的父级(一对多外键关系),C 是 D 的父级(一对多外键关系)
现在我必须加入这些表格;加入这些表格的最佳方法是什么
我需要创建一个表 E,其中 A、B、C、D 的列在 A、B、C 的列中重复值是可以的
【问题讨论】:
-
我猜 hive 有能力自行优化连接。它有一个类似
set hive.auto.convert.join = true的配置设置not only converts joins to mapjoins but also merges MJ* patterns as much as possible
标签: hive bigdata hiveql hadoop2