【发布时间】:2015-10-09 17:06:01
【问题描述】:
我已经下载了大约 2GB 的百万歌曲数据集的子集。但是,数据被分解为文件夹和子文件夹。在子文件夹中,它们都是几种“H5 文件”格式。我知道可以使用 Python 读取它。但我不知道如何提取并加载到 HDFS 中,这样我就可以在 Pig 中运行一些数据分析。 我是否将它们提取为 CSV 并加载到 Hbase 或 Hive ?如果有人能指出我正确的资源,那将会有所帮助。
【问题讨论】:
标签: python hadoop hive hbase bigdata