【发布时间】:2016-10-26 18:01:45
【问题描述】:
我对决定解决我的问题的技术和方法感到困惑。
我有 5000 个测试文件,其中包含从 RDBMS 生成的大约 4TB 数据,准备所有 5k 文本文件需要大约 4 天的时间。为了解决这个时间问题,我正在考虑移动我所有的 5k将文本文件数据导入 Hadoop 系统,以便从那里更快地读取数据并更快地生成文本文件。
我必须在数据增加后第一次执行此活动,但每个月我必须生成 5k 个文本文件。
通常我必须进行全表扫描,并且可能必须执行一些连接才能准备 5 K 文件。
任何人都可以建议我应该为这种情况考虑哪种工具。 MapReduce 和 HBase 或 HIVE 表或其他东西。
【问题讨论】:
-
全表扫描,使用HIVE。
标签: hadoop mapreduce hive hbase