【发布时间】:2018-09-11 10:24:05
【问题描述】:
我有一张桌子缺少一些部分。当我在 hive 上调用它时,它工作正常
SELECT *
FROM my_table
但是当从 pyspark (v. 2.3.0) 调用它时,它会失败并显示消息 Input path does not exist: hdfs://path/to/partition。我正在运行的 spark 代码很天真:
spark = ( SparkSession
.builder
.appName("prueba1")
.master("yarn")
.config("spark.sql.hive.verifyPartitionPath", "false")
.enableHiveSupport()
.getOrCreate())
spark.table('some_schema.my_table').show(10)
已提议的config("spark.sql.hive.verifyPartitionPath", "false") 是
this 问题,但对我来说似乎不能正常工作
有什么方法可以配置 SparkSession,这样我就可以摆脱这些。恐怕以后会漏掉更多的分区,所以硬编码的解决方案是不可能的
【问题讨论】:
-
您的表是外部的吗?如果是这样,您可以尝试通过 hive 对 hive 表进行 msck 修复或更改表添加分区
标签: apache-spark hive pyspark pyspark-sql