【发布时间】:2021-09-22 20:18:32
【问题描述】:
我正在使用 Spark scala 进行开发,我想合并数据框中的一些行...
我的数据框是下一个:
+-------------------------+-------------------+---------------+------------------------------+
|name |col1 |col2 |col3 |
+-------------------------+-------------------+---------------+------------------------------+
| a | null| null| 0.000000|
| a | 0.000000| null| null|
| b | null| null| 0.000000|
| b | 300.000000| null| null|
+-------------------------+-------------------+---------------+------------------------------+
我想开启下一个数据框:
+-------------------------+-------------------+---------------+------------------------------+
|name |col1 |col2 |col3 |
+-------------------------+-------------------+---------------+------------------------------+
| a | 0.000000| null| 0.000000|
| b | 300.000000| null| 0.000000|
+-------------------------+-------------------+---------------+------------------------------+
考虑到:
-某些列的所有值都可以为空。
-一个数据框中可以有很多列。
据我所知,我必须将 groupBy 与 agg() 一起使用,但我无法获得正确的表达式:
df.groupBy("name").agg()
【问题讨论】:
标签: scala dataframe apache-spark row