【问题标题】:MySQL and HBase Optimized data storage (1 TB)MySQL 和 HBase 优化的数据存储 (1 TB)
【发布时间】:2015-03-18 20:59:41
【问题描述】:

我有大约 6 亿行数据是 157 个 CSV 文件。数据格式如下:

A: 8 digit int
B: 64bit unsigned int
C: 140 characters long string
D: int

我将使用 CSV 将数据加载到 MySQL 和 HBase 数据库中。我正在决定如何优化加载过程?我需要有关以下查询的帮助:

  1. 使用单个表存储所有数据或将其分片到多个表中
  2. 我可以做哪些优化来减少加载时间?
  3. 提高数据库的整体性能?是否应该规范化表以存储信息?

我将使用一个 M1.Large EC2 实例将 CSV 加载到 MySQL 和 HBase 数据库中。

============更新=============
我使用了一个 C3.8XLarge 实例,加载 20 个 CSV 文件(总共 157 个)每个 250Mb 需要 2 个小时。最终我 不得不停止它,因为它花费了太长时间。 CPU利用率仅为 整个时间段内的 2%。如果有人可以提供帮助,请 做!

【问题讨论】:

    标签: mysql sql csv amazon-ec2 hbase


    【解决方案1】:

    对于 HBase,可以使用标准的CSV Bulk Load 对于 MySQL,您必须使用常规的 CSV MySQL Load

    规范化数据由您决定。 查看您的数据结构,我认为您可能不需要规范化。

    【讨论】:

    • 只有当你有小数据集时它才有效。该方法不可扩展。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-02-13
    • 1970-01-01
    • 2011-01-23
    • 2011-11-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多