【发布时间】:2018-09-17 17:42:30
【问题描述】:
假设我有一个数据框,其中包含一个列(称为 colA),它是行的序列。我想为 colA 的每条记录附加一个新字段。 (而且新的归档是和之前的记录相关联的,所以我要写一个udf。) 这个udf应该怎么写?
我尝试编写一个 udf,它将 colA 作为输入,并输出 Seq[Row],其中每条记录都包含新文件。但问题是 udf 无法返回 Seq[Row]/ 例外是“不支持 org.apache.spark.sql.Row 类型的架构”。 我该怎么办?
我写的udf:
val convert = udf[Seq[Row], Seq[Row]](blablabla...)
例外是 java.lang.UnsupportedOperationException:不支持 org.apache.spark.sql.Row 类型的架构
【问题讨论】:
-
如果您的最终组合行是固定的,则创建一个案例类并使用它。您必须向我们提供更多信息以获得详细答案
-
输入列的类型是什么?即你的“行”中有什么?
标签: scala apache-spark user-defined-functions