【发布时间】:2018-05-31 06:28:41
【问题描述】:
根据我对 Hive 概念的理解,如果我们将数据集加载到 hive 表中,数据文件将从源路径移动到 HDFS 内的 hive 仓库,并且 HDFS 设置为数据的三个副本。
这些问题可能看起来很傻,但作为初学者,我想清除我的疑虑。
我的问题是:
1) 如果我删除 hive 表,它会仅从 hive 仓库中删除数据文件,还是从 HDFS 中删除其他两个副本?
2)如果我们在 hive 表上处理查询,该查询是否会作为分布式处理完成? 比如说,一个数据文件的大小为 1GB(实习生 8 个块 x 128MB),并且由于我们有三个复制因子,因此该文件总共有 24 个块可用 我们的 Hive 查询是分布在所有数据块中还是仅在 Hive 仓库块上处理?
提前谢谢..
【问题讨论】:
标签: hive