【发布时间】:2020-03-16 01:15:16
【问题描述】:
关于 Spark 中 Scala 中的 DataFrame,我可能有一个简单而快速的问题。
我有一个现有的 Spark DataFrame(使用 Scala 2.10.5 和 Spark 1.6.3 运行)并且想添加一个具有 ArrayType 或 MapType 的新列,但不知道如何实现。但不知道如何处理。我不想使用“单个”值创建多个列,而是将它们存储在一列中。它会缩短我的代码并使其更容易更改。
import org.apache.spark.sql.types.MapType
...
// DataFrame initial creation
val df = ...
// adding new columns
val df_new = df
.withColumn("new_col1", lit("something_to_add") // add a literal
.withColumn("new_col2"), MapType("key1" -> "val1", "key2" -> "val2")) // ???
【问题讨论】:
标签: scala dataframe apache-spark