【发布时间】:2015-03-18 20:59:41
【问题描述】:
我有大约 6 亿行数据是 157 个 CSV 文件。数据格式如下:
A: 8 digit int
B: 64bit unsigned int
C: 140 characters long string
D: int
我将使用 CSV 将数据加载到 MySQL 和 HBase 数据库中。我正在决定如何优化加载过程?我需要有关以下查询的帮助:
- 使用单个表存储所有数据或将其分片到多个表中
- 我可以做哪些优化来减少加载时间?
- 提高数据库的整体性能?是否应该规范化表以存储信息?
我将使用一个 M1.Large EC2 实例将 CSV 加载到 MySQL 和 HBase 数据库中。
============更新=============
我使用了一个 C3.8XLarge 实例,加载 20 个 CSV 文件(总共 157 个)每个 250Mb 需要 2 个小时。最终我 不得不停止它,因为它花费了太长时间。 CPU利用率仅为 整个时间段内的 2%。如果有人可以提供帮助,请 做!
【问题讨论】:
标签: mysql sql csv amazon-ec2 hbase