【发布时间】:2020-12-30 03:56:26
【问题描述】:
我在 AWS S3 中有超过 2 个月的数据,这些数据由 day 分区和存储。我想通过我创建的外部表开始使用数据。
目前我只看到几个分区,我想确保我的元数据能够提取所有分区。在登录到 EMR Cluster 的主节点后,我尝试使用 msck repair table tablename 使用 hive。但是,可能由于数据量的原因,执行该命令需要花费大量时间。
我可以执行 msck 修复表以便只能加载特定日期吗? msck 是否允许加载特定分区?
【问题讨论】:
标签: apache-spark hive