【发布时间】:2014-04-25 04:33:48
【问题描述】:
我是 Hadoop 新手,目前正在设计我的 MapReduce 应用程序。在我的场景中,我有一个 csv 文件。我希望对 csv 文件中的每一行进行平均,以便为每一行创建一个单独的映射器。据我了解, TextInputFormat 会自动逐行拆分文件。那么我是否理解,也会自动为每一行创建一个单独的映射器?如果没有,如何告诉 Hadoop 做我想做的事?我必须实现自定义拆分器吗?谢谢!
【问题讨论】:
我是 Hadoop 新手,目前正在设计我的 MapReduce 应用程序。在我的场景中,我有一个 csv 文件。我希望对 csv 文件中的每一行进行平均,以便为每一行创建一个单独的映射器。据我了解, TextInputFormat 会自动逐行拆分文件。那么我是否理解,也会自动为每一行创建一个单独的映射器?如果没有,如何告诉 Hadoop 做我想做的事?我必须实现自定义拆分器吗?谢谢!
【问题讨论】:
没关系。我想到了。我需要使用 NLineInputFormat。
【讨论】: