【发布时间】:2020-06-28 10:53:43
【问题描述】:
我有一个外部表,分区为 3 列并存储在 hdfs 中:
/apps/var/db_name/table_name/date=1901/ref_src=src_a
/apps/var/db_name/table_name/date=1901/ref_src=src_b
/apps/var/db_name/table_name/date=1902/ref_src=src_a
/apps/var/db_name/table_name/date=1902/ref_src=src_b
/apps/var/db_name/table_name/date=1903/ref_src=src_a
/apps/var/db_name/table_name/date=1903/ref_src=src_b
/apps/var/db_name/table_name/date=1903/ref_src=src_c
table_name 中的字段:
date|ref_src|col_a|col_b|
现在,根据一些要求,我必须创建新列 - col_c 和 col_d。 所以,我计划了一些程序来将计算的数据覆盖到同一个表中。 但是,我触发了问题/问题,如果我的程序运行时出现任何问题导致表数据损坏或删除或我的程序有问题怎么办?
所以,我的主要问题是如何对 hdfs 数据(平均表数据)和分区详细信息进行表备份。 如果我将完整目录作为备份将有所帮助或其他任何我需要注意的事项,我主要关心的是产品数据。
【问题讨论】:
标签: pyspark hive hdfs hadoop-partitioning