【发布时间】:2021-05-26 21:45:31
【问题描述】:
我想在集群模式下使用 ray.io 来合并两个几乎无法放入内存的大型数据集(大约相同数量的记录)。
Apache Spark 的join 可以做到这一点,但我的程序在 onprem DC 中运行,而 k8s 上的 Spark 尚不支持/可用。
Ray.io 看起来更轻量级并且更容易获得批准,因为它允许扩展其他 ML 相关任务(即并行化 xgboost 等)
所以我正在寻找如何使用 ray.io 实现join 操作。 Group By 或一般 shuffle 也可以让我实现 join。
【问题讨论】: