【发布时间】:2019-03-01 21:12:39
【问题描述】:
我有一个数据集
+----------+--------+------------+
| id| date| errors|
+----------+--------+------------+
|1 |20170319| error1|
|1 |20170319| error2|
|1 |20170319| error2|
|1 |20170319| error1|
|2 |20170319| err6|
|1 |20170319| error2|
需要每天计算错误数
输出
+----------+--------+------------+
| date| errors| count
+----------+--------+------------+
|20170319| error1| 2
|20170319| error2| 3
|20170319| err6| 1
val dataset = spark.read.json(path);
val c =dataset.groupBy("date").count()
//我如何进行错误计数
我在 spark scala sql 中尝试过过时的窗口化,但无法找到生产力 我需要转换为 Rdd 并找到方法吗?
【问题讨论】:
-
尝试将
groupBy("date")更改为groupBy("date", "errors") -
是的,工作..谢谢
标签: sql scala apache-spark apache-spark-sql apache-spark-dataset