【发布时间】:2019-07-01 22:14:26
【问题描述】:
我有一个数据集列表,我想按我所有数据集共有的特定键进行分区,然后运行一些对所有分区数据集都相同的连接/分组。
我正在尝试以这样一种方式设计算法,即我使用 Spark 的 partitionBy 通过特定键创建分区。
现在,一种方法是循环运行每个分区上的操作,但这并不高效。
我想看看我是否有手动分区数据,我可以在这些数据集上并行运行操作。
我刚刚开始学习 Spark,如果这是一个幼稚的问题,请原谅我。
考虑不同数据集中的客户 ID 及其行为数据(例如浏览/点击等)数据集。说一个用于浏览,另一个用于点击。首先,我正在考虑按客户 ID 对我的数据进行分区,然后对于每个分区(客户),加入某些属性,例如浏览器或设备,以查看每个客户的行为方式。所以基本上,它就像一个嵌套的并行化。
这在 Spark 中是否可行?我有什么明显的遗漏吗?我可以参考一些文档?
【问题讨论】:
标签: algorithm scala apache-spark dataset