【发布时间】:2017-03-22 06:52:48
【问题描述】:
我正在尝试旋转具有超过 10000 个不同值的列。 Spark 中最大不同值的默认限制为 10000,我收到此错误
数据透视列
COLUMN_NUM_2有超过 10000 个不同的值,这可能表示错误。如果这是有意为之,请将 spark.sql.pivotMaxValues 至少设置为数据透视列的不同值的数量
如何在 PySpark 中进行设置?
【问题讨论】:
标签: pyspark pyspark-sql
我正在尝试旋转具有超过 10000 个不同值的列。 Spark 中最大不同值的默认限制为 10000,我收到此错误
数据透视列
COLUMN_NUM_2有超过 10000 个不同的值,这可能表示错误。如果这是有意为之,请将 spark.sql.pivotMaxValues 至少设置为数据透视列的不同值的数量
如何在 PySpark 中进行设置?
【问题讨论】:
标签: pyspark pyspark-sql
您必须在 Spark 解释器中添加/设置此参数。
我在 EMR (AWS) 集群上使用 Zeppelin 笔记本,出现与您相同的错误消息,并且在我在解释器中添加参数后它工作正常。
希望这会有所帮助...
【讨论】: