【发布时间】:2011-07-27 16:46:26
【问题描述】:
像 Hadoop 这样的开源分布式计算框架的效率如何?通过效率,我的意思是 CPU 周期可用于主要是纯计算的任务中的“实际工作”。换句话说,有多少 CPU 周期被用于开销,或者因为没有被使用而被浪费?我不是在寻找具体的数字,只是一个粗略的图片。例如。我可以期望使用集群 90% 的 CPU 能力吗? 99%? 99.9%?
更具体地说,假设我要计算 PI,并且我有一个算法 X。当我在紧密循环中的单个内核上执行此操作时,假设我获得了一些性能 Y。如果我在使用例如分布式方式Hadoop,我可以预期多少性能下降?
我知道这取决于许多因素,但大概的大小是多少?我正在考虑一个可能有 10 到 100 台服务器(总共 80 到 800 个 CPU 内核)的集群,如果这很重要的话。
谢谢!
【问题讨论】:
标签: performance hadoop mapreduce