【问题标题】:How to import large mysql dumps into hadoop?如何将大型mysql转储导入hadoop?
【发布时间】:2013-05-23 00:15:03
【问题描述】:

我需要将维基百科转储(mysql 表,解压文件大约 50gb)导入 Hadoop(hbase)。现在首先我将转储加载到 mysql 中,然后将数据从 mysql 传输到 hadoop。但是将数据加载到 mysql 需要大量时间 - 大约 4-7 天。是否可以将mysql转储直接加载到hadoop(通过一些转储文件解析器或类似的东西)?

【问题讨论】:

  • 为什么要将数据移动到 mysql 中?您是否将其用于进一步处理?如果没有,那么有一种方法可以将数据直接放入 hadoop。将根据您的回复添加答案
  • 也许你可以利用sqoop.apache.org

标签: mysql hadoop sqoop


【解决方案1】:

据我所知 - MySQL Dumps 几乎完全是一组插入语句。您可以在映射器中解析它们并按原样处理......如果您只有几个表,那么在 java 中硬代码解析应该是微不足道的。

【讨论】:

  • 是的,它有效。将 7.6 亿条记录转储转储为 csv 格式仅需 1 小时。之后导入到 hadoop 或 mongo 是微不足道的。
  • Hudvin,你能分享你的脚本来解析 .sql 转储吗?
【解决方案2】:

使用 sqoop 。使用 map reduce 作业将 mysql 数据导入 HDFS 的工具。

很方便。

【讨论】:

猜你喜欢
  • 2018-10-01
  • 1970-01-01
  • 1970-01-01
  • 2012-11-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多