【发布时间】:2016-05-05 05:45:31
【问题描述】:
我使用命令行实用程序创建了一个 har 文件:hadoop archive。
如何在 mapreduce 或 spark 中读取 HAR 文件的内容?有可以理解HAR文件的FileInputFormat吗?
按照答案...这里是简单的猪脚本,以防其他人感兴趣:
A = LOAD 'har:///user/me/my.har/*.parquet'
USING parquet.pig.ParquetLoader
('key:chararray')
;
【问题讨论】:
标签: hadoop apache-spark