【发布时间】:2018-03-28 11:12:49
【问题描述】:
我正在使用 Spark 2.2,但在尝试通过 Seq 或 Map 调用 spark.createDataset 时遇到了麻烦。
我的 Spark Shell 会话的代码和输出如下:
// createDataSet on Seq[T] where T = Int works
scala> spark.createDataset(Seq(1, 2, 3)).collect
res0: Array[Int] = Array(1, 2, 3)
scala> spark.createDataset(Seq(Map(1 -> 2))).collect
<console>:24: error: Unable to find encoder for type stored in a Dataset.
Primitive types (Int, String, etc) and Product types (case classes) are
supported by importing spark.implicits._
Support for serializing other types will be added in future releases.
spark.createDataset(Seq(Map(1 -> 2))).collect
^
// createDataSet on a custom case class containing Map works
scala> case class MapHolder(m: Map[Int, Int])
defined class MapHolder
scala> spark.createDataset(Seq(MapHolder(Map(1 -> 2)))).collect
res2: Array[MapHolder] = Array(MapHolder(Map(1 -> 2)))
我已经尝试过import spark.implicits._,但我相当确定这是由 Spark shell 会话隐式导入的。
这是当前编码器未涵盖的情况吗?
【问题讨论】:
标签: scala apache-spark apache-spark-sql apache-spark-dataset apache-spark-encoders