【发布时间】:2016-08-25 07:54:23
【问题描述】:
我目前正在尝试在 Google DataProc 上的 Spark 2.0.0 中的大型数据集(30 个 mio 观察值,13 个变量)上运行 ml 决策树。 当我执行时:
labelIndexer = StringIndexer(inputCol="Target", outputCol="indexedLabel").fit(data)
我收到以下错误:
IllegalArgumentException: u'requirement failed: Invalid initial capacity'
我在互联网上没有找到很多关于此错误的信息。有人可以解释一下问题是什么以及如何解决吗?
【问题讨论】:
标签: apache-spark apache-spark-ml google-cloud-dataproc