【发布时间】:2015-09-05 10:51:59
【问题描述】:
我最近阅读了很多关于 hadoop 的内容,我可以说我了解它的一般概念,但仍然(至少)有一部分是我无法理解的。在 hdfs 中存储关系数据的最佳方式是什么?
首先,我知道不存在 hadoop 来替代为我的应用程序服务的传统良好的旧 sql 数据库。我在这里面临的问题是我想使用 hadoop 将来自多个系统的数据聚合到 hdfs 中。然后我可以交叉引用来自多个系统的数据,然后生成我的报告工具等使用的新数据集。
好的,那么,我应该使用一个表将表数据导入一个文件,还是应该导入连接表的查询结果。
例如:
SQL 表:
人: 个人ID 姓名 生日 性
公司:
CompanyID
Name
Address
个人公司
PersonID
CompanyID
我应该按原样导入所有 3 个表,还是应该导入查询的结果返回为什么人为哪家公司工作。
请与我分享你的想法!
【问题讨论】: