【发布时间】:2017-01-28 06:02:10
【问题描述】:
我在 hive 中有 1000 个表。都有相同的列。这些表将逐步更新。列是 ID、名称、dno、loc、sal ..... 我想通过从每个表中仅选择 Id、name 和 sal 来创建一个大表。
Table 1:
ID name dno loc sal ………
1 sam 201 HYD 2000 ………
Table2
ID name dno loc sal ………
2 Ram 203 BAN 3000 ………
Table 3
ID name dno loc sal ………
3 Bam 301 NY 4000 ………
等等……
大桌子:
ID name sal
1 sam 2000
2 Ram 3000
3 Bam 4000
等等
这就是我想要达到的目标。
如果明天有新记录插入到表 3 中,说 ID 为 100,命名为 jack ...。
带有新记录的表 3
Table 3
ID name dno loc sal ………
3 Bam 301 NY 4000 ………
100 Jack 101 LA 5000 ……….
新的大表应该是
ID name sal
1 sam 2000
2 Ram 3000
3 Bam 4000
100 Jack 5000
这是我想要在每次将新记录插入原始 1000 个表时不删除大表来实现的目标
【问题讨论】:
标签: join apache-spark hive