【发布时间】:2016-06-09 10:16:37
【问题描述】:
我想使用 spark 将第一个 DStream 更改为第二个。但我不知道该怎么做?我已经尝试过 groupByKey(),它不起作用和 aggregateByKey(),它只使用 RDD 而不是 DStream。
这是当前结果:
DStream [(1,value1),(2,value2),(3,value3),(1,value4),(1,value5),(2,value6)]
这是我想要的结果:
DStream(1,(value1,value4,value5)) ,(2,(value2,value5)) ,(3,(value3))
感谢您的回复。
【问题讨论】:
-
groupByKey是什么意思没用? -
将相同的键与 groupByKey 结合使用时不会给我相同的键和值对。这意味着它没有给我这个结果:DStream(1,(value1,value4,value5)),(2,(value2,value5)),(3,(value3))。我不知道该怎么做,也许我使用 groupByKey 错误?
标签: apache-spark spark-streaming datastax-enterprise