【问题标题】:Tool for distributed task execution分布式任务执行工具
【发布时间】:2016-01-27 17:08:23
【问题描述】:

仅将 spark 用于分布式任务执行是否有益。我有处理大型数据集的要求(从数据库读取、处理、写入数据库),但是完成的处理是行级的。这意味着我不需要 reduce 或机器学习。

使用 spark 来满足这种要求会不会有点过头了。什么最适合这种要求。我不想编写将优化分布、处理故障、重试等的软件基础架构

【问题讨论】:

    标签: apache-spark distributed distributed-computing


    【解决方案1】:

    Spark 更适用于处理(真正的)大型数据集和内存。一种选择是使用任何开源 IMDG 并以类似的方式处理数据,但(也许)复杂性较低。

    您还可以根据要使用的语言选择 IMDG 引擎。对于.Net,您可以使用NCache,对于Java,有很多,但您可以使用TayzGrid

    【讨论】:

    • 感谢您的回复。从功能的角度来看,无论是 spark 还是 TayzGrid,对我来说都是一样的。如果数据大小是唯一的标准,我处理的数据范围从 MB 到数百 GB 的不同请求。
    • 很高兴为您提供帮助。任何正在使用的技术的过度杀伤力都可以通过它产生的技术债务来计算。简单地说,你投入的时间和金钱值得吗?当您得到答案时,您将选择您的技术。
    猜你喜欢
    • 2017-01-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-02-13
    • 1970-01-01
    • 2020-10-22
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多