【发布时间】:2013-05-23 00:15:03
【问题描述】:
我需要将维基百科转储(mysql 表,解压文件大约 50gb)导入 Hadoop(hbase)。现在首先我将转储加载到 mysql 中,然后将数据从 mysql 传输到 hadoop。但是将数据加载到 mysql 需要大量时间 - 大约 4-7 天。是否可以将mysql转储直接加载到hadoop(通过一些转储文件解析器或类似的东西)?
【问题讨论】:
-
为什么要将数据移动到 mysql 中?您是否将其用于进一步处理?如果没有,那么有一种方法可以将数据直接放入 hadoop。将根据您的回复添加答案
-
也许你可以利用sqoop.apache.org