【发布时间】:2017-09-16 16:18:44
【问题描述】:
我正在尝试每分钟使用 Spark 流式传输(从 Kafka 读取)聚合并查找一些指标。我能够汇总那一分钟的数据。如何确保我可以拥有当天的存储桶并总结当天所有分钟的所有汇总值?
我有一个数据框,我正在做类似的事情。
sampleDF = spark.sql("select userId,sum(likes) as total from likes_dataset group by userId order by userId")
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql spark-streaming spark-dataframe