【发布时间】:2019-03-23 22:20:00
【问题描述】:
我有一个mapreduce作业,文件输入路径是:/basedirectory/*/*.txt
在基本目录中,我有不同的子文件夹(CaseA、CaseB 等),每个子文件夹都包含 hdfs 文本文件。
在作业的映射阶段,我想找出数据分片的确切来源(例如 CaseA)。我怎样才能做到这一点?
我为具有超过 1 个输入 hbase 表的 mapreduce 作业做了类似的事情,我使用 context.getInputSplit().getTableName() 来查找实际的表名,但不确定如何处理 HDFS 输入文件。
【问题讨论】: