【发布时间】:2011-04-12 11:01:01
【问题描述】:
这可能是一个基本问题,但我在 Google 上找不到答案。
我有一个 map-reduce 作业,它在其输出目录中创建多个输出文件。
我的 Java 应用程序在远程 hadoop 集群上执行此作业,作业完成后,它需要使用org.apache.hadoop.fs.FileSystem API 以编程方式读取输出。有可能吗?
应用程序知道输出目录,但不知道 map-reduce 作业生成的输出文件的名称。似乎没有办法以编程方式列出 hadoop 文件系统 API 中目录的内容。如何读取输出文件?
这似乎是一个司空见惯的场景,我相信它有一个解决方案。但我遗漏了一些非常明显的东西。
【问题讨论】: