【发布时间】:2020-11-17 00:56:07
【问题描述】:
我有一个配置单元表,上面的数据每天都会增加。在特定的一天,一些损坏的记录被插入到表中。有没有办法可以将表与 HDFS 上的主文件匹配并从 Hive 中提取损坏的记录
或
如何识别具有 100 万行的 hive 表中的损坏记录?
【问题讨论】:
-
1.当您说“数据每天都在增加”时,您是在手动将数据从 HDFS 文件加载到 Hive
-
@BruceWayne - 是的,每天都会将文件添加到 HDFS,然后将数据加载到 Hive 表中。
标签: apache-spark hadoop hive hdfs