【发布时间】:2021-10-05 04:50:33
【问题描述】:
我正在尝试将 pyspark dataframewriter 的 saveAsTable 与覆盖模式一起用于配置单元全表刷新用例。我想最大限度地减少我的 impala 用户的表可用性的停机时间,我的 impala 用户可以查询旧数据,直到 spark 加载作业完成。
从我使用 spark 2.4.0 的测试结果中看到,该表对用户不可用,并且在 spark 作业开始后立即被截断,无论该表是外部的还是托管的。
Spark/Hive 有什么开箱即用的解决方案来解决这个可用性问题吗?
【问题讨论】:
标签: apache-spark pyspark hive apache-spark-sql