【发布时间】:2019-11-27 06:36:23
【问题描述】:
我有一个示例Dataset<Row> 如下
+----+----+
|col1|col2|
+----+----+
| a| a |
| a| b |
| b| c |
| c| d |
+----+----+
基于映射值 Map sample ={"key1" = 2,"key2"=4} 我必须为每一行添加一个 row_number 以便 where col1 or col2 = 'a' 我必须添加 2 个连续的行号和其他作为 4基于来自map 的值,结果应如下所示。
无论col1 or col2 ='a' 行在哪里复制了两次 次,如果不是,它复制了四次 次,后面是数字
+----+----+----------+
|col1|col2|limit_fact|
+----+----+----------+
| a| a | 1|
| a| a | 2|
| a| b | 3|
| a| b | 4|
| b| c | 5|
| b| c | 6|
| b| c | 7|
| b| c | 8|
| c| d | 9|
| c| d | 10|
| c| d | 11|
| c| d | 12|
+----+----+----------+
【问题讨论】:
标签: java apache-spark row-number apache-spark-dataset