【发布时间】:2020-10-22 13:36:40
【问题描述】:
我在 pyspark 中使用 hive llap(https://github.com/hortonworks-spark/spark-llap) 来读取 hive 内部表,如下所示:
df = hive.table(<tableName>)
但问题是我的表有 1800 万条记录,但是当我这样做时
df.count()
我只计算了 750 万,这是错误的
【问题讨论】:
-
答案有帮助吗?
标签: apache-spark pyspark hive apache-spark-sql