【发布时间】:2017-06-01 09:45:50
【问题描述】:
MapReduce 和 HDFS 的数据本地化非常重要(Spark、HBase 也是如此)。我一直在研究 AWS 以及在他们的云中部署集群时的两个选项:
- EC2
- EMR + S3
由于不同的原因,第二个选项似乎更有吸引力,其中最有趣的是能够单独扩展存储和处理以及在不需要时关闭处理(更正确的是,仅在需要时才打开它)。 This 是一个示例,说明了使用 S3 的优势。
困扰我的是数据局部性问题。如果数据存储在 S3 中,则每次运行作业时都需要将其拉到 HDFS。我的问题是 - 这个问题有多大,还值得吗?
让我感到欣慰的是,我只会在第一次提取数据,然后所有下一个作业都会在本地获得中间结果。
我希望从对此有实际经验的人那里得到答案。谢谢。
【问题讨论】:
-
非常好的问题,不主观,无缘无故关闭。
标签: amazon-web-services hadoop amazon-s3 amazon-ec2 amazon-emr