【问题标题】:Which FileInputFormat to use to read Hadoop Archive Files (HAR) files使用哪个 FileInputFormat 来读取 Hadoop 存档文件 (HAR) 文件
【发布时间】:2016-05-05 05:45:31
【问题描述】:

我使用命令行实用程序创建了一个 har 文件:hadoop archive

如何在 mapreduce 或 spark 中读取 HAR 文件的内容?有可以理解HAR文件的FileInputFormat吗?


按照答案...这里是简单的猪脚本,以防其他人感兴趣:

A =     LOAD 'har:///user/me/my.har/*.parquet'  
        USING parquet.pig.ParquetLoader 
        ('key:chararray')
        ;

【问题讨论】:

    标签: hadoop apache-spark


    【解决方案1】:

    来自Hadoop Archives and MapReduce

    在 MapReduce 中使用 Hadoop 存档就像指定与默认文件系统不同的输入文件系统一样简单。如果您有一个 hadoop 存档存储在 HDFS 中的/user/zoo/foo.har 中,那么要将此存档用于 MapReduce 输入,您只需将输入目录指定为 har:///user/zoo/foo.har。由于 Hadoop Archives 作为文件系统公开,MapReduce 将能够使用 Hadoop Archives 中的所有逻辑输入文件作为输入。

    因此,您应该能够使用任何 FileInputFormat 来读取相同文件的 HDFS 目录。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-05-18
      • 1970-01-01
      • 2020-10-25
      相关资源
      最近更新 更多