【发布时间】:2012-03-19 16:26:43
【问题描述】:
我想运行一个 hadoop 单元测试,使用本地文件系统模式...我希望看到几个 part-m-* 文件写入磁盘(而不仅仅是 1 个)。但是,由于它只是一个测试,我不想处理 64M 的数据(我相信默认大小是每块 ~64megs)。
在分布式模式下,我们可以使用
dfs.block.size
我想知道是否有一种方法可以让我的本地文件系统将小部分 m 文件写出,即我的单元测试将模拟包含多个(尽管非常小的)文件的大规模数据的内容。
【问题讨论】: