【发布时间】:2013-03-27 17:56:18
【问题描述】:
我会在hadoop中复制很多压缩为gzip的大型博客文件。 我需要在这些文件上运行许多 map/reduce。
据我了解,只有一个 Map/Reduce 将按文件运行。 就我而言,这是不可接受的,因为我们需要尽快完成这些工作。
将 gzip 文件拆分成更小的块(在将它们复制到 hadoop 之前或之后)是常见的做法吗? 能够运行尽可能多的 map/reduce 吗?
感谢您的帮助。
【问题讨论】:
-
我有一个包含大量 gzip 文件的远程备份服务器。我将在 hadoop 中复制它们。我将再次编辑我的问题。
-
还不清楚。你只是复制文件?你不解压吗?