【发布时间】:2014-09-18 17:18:51
【问题描述】:
我已经开始研究 Hadoop。如果我的理解是正确的,我可以处理一个非常大的文件,它会被分割到不同的节点上,但是如果文件被压缩,那么文件就不能被分割并且需要由单个节点处理(有效地破坏了在并行机器集群上运行 mapreduce)。
我的问题是,假设上述是正确的,是否可以将大文件手动拆分为固定大小的块或每日块,压缩它们,然后传递压缩输入文件的列表以执行 mapreduce?
【问题讨论】:
标签: compression hadoop