【发布时间】:2014-06-17 19:19:40
【问题描述】:
我对Hadoop不是很熟悉,也不是数据库方面的专家,我只是想知道通过使用Hadoop,HBase或Pig,Hive(一起或单独)是否可以提高“select”的SQL查询的执行速度" 或 "插入"。
问题是,本来数据是存储在微软SQL等工具上进行密集聚合的东西,但是速度很慢,对于数据集,可能是GB大小,需要几分钟才能返回结果(例如select)。
我正在考虑是否可以将数据放在 Hadoop HDFS 上,并使用 Apache 提供的一些工具以及 MR 来重写 SQL(选择、插入 No_SQL 模式中的函数,但更喜欢功能性或更面向编程的模式) 可以提高处理速度吗?
以及有关如何执行此操作或我的方向是否正确的建议?
谢谢!
【问题讨论】:
-
如果数据只有几GB,hadoop可能没什么用。更好的方法是优化表结构,例如,添加索引。
-
如果您使用 Sql Server 并想做分析查询(和聚合),也许您应该看看column storage。不要认为 Hadoop 非常适合这种情况。
-
@zsxwing 感谢您的回复。问题是,试用版只有 GB,但可以是更多数据。