【发布时间】:2018-05-01 08:34:16
【问题描述】:
我使用:`
dataset.withColumn("lead",lead(dataset.col(start_date),1).over(orderBy(start_date)));
` 我只想按 trackId 添加组,以便通过任何 agg 函数来领导每个组的工作:
+----------+---------------------------------------------+
| trackId | start_time | end_time | lead |
+-----+--------------------------------------------------+
| 1 | 12:00:00 | 12:04:00 | 12:05:00 |
+----------+---------------------------------------------+
| 1 | 12:05:00 | 12:08:00 | 12:20:00 |
+----------+---------------------------------------------+
| 1 | 12:20:00 | 12:22:00 | null |
+----------+---------------------------------------------+
| 2 | 13:00:00 | 13:04:00 | 13:05:00 |
+----------+---------------------------------------------+
| 2 | 13:05:00 | 13:08:00 | 13:20:00 |
+----------+---------------------------------------------+
| 2 | 13:20:00 | 13:22:00 | null |
+----------+---------------------------------------------+
有什么帮助吗?
【问题讨论】:
标签: apache-spark apache-spark-sql apache-spark-dataset