Cloudera与Twitter携手合作,为Hadoop开源了一种新的列式存储格式,称为Parquet。
二人说,由 Github托管的项目 旨在为 Hadoop生态系统的任何齿轮部分 提供“ 压缩的,高效的列式数据表示”,这意味着Parquet与语言和数据模型无关。
像Impala和Apache Drill等新兴项目一样, Parquet大量借鉴了Google在2010年发表的研究论文 Dremel中的 想法 ,该论文率先采用了重复/定义级方法来编码嵌套数据结构。 Parquet分离了编码和压缩概念,使开发人员可以为每列指定压缩方案并在编码数据上实现运算符,而不必担心解压缩。
Hadoop的主要列数据库是HBase,但是该项目背后的团队坚持认为,该项目不是要淘汰旧的收藏夹,而是在充满活力的生态系统中提供更多选择。
Twitter的Google Analytics(分析)基础架构团队的成员 Dimitriy Ryaboy 保证说:“ Parquet可以供任何人使用 。”
“ Hadoop生态系统拥有丰富的数据处理框架,我们对发挥自己的最爱并不感兴趣。 我们认为,高效,实施良好的柱状存储基板应适用于所有框架,而无需花费大量且难以建立依赖关系。
Cloudera将在其实时查询引擎 Impala中 包括Parquet的预览 。 Ryaboy透露,两者合而为一,与竞争对手相比,Impala的性能提高了10倍,并且相信还有“改进的空间”。
尽管该项目显然已经开放给其他厂商参与,但Cloudera希望这个最新的项目能够为反对者铺平道路。
Hadoop同行供应商Hortonworks上个月推出了 “毒刺计划” ,解释了他们计划如何翻新HBase,并采用了另一种通往Cloudera的途径。 未来几个月内,更新旧的或重新开始是否会带来红利将是很有趣的。
另一个合作伙伴,Twitter已经开始在生产中使用该工具,并将其一些主要数据源转换为Parquet的方法。 它仍在大量开发中,并在不久的将来计划了一些功能。 这包括对数据仓库系统Hive和Hadoop的抽象层Cascading(由Criteo提供)的支持,以及对已经存在的Pig支持的改进。
团队欢迎对Parquet的反馈,并计划将其提交给Apache Incubator,以期在其背后建立一个社区。
翻译自: https://jaxenter.com/cloudera-and-twitter-bring-parquet-to-the-hadoop-floor-105802.html