Cloudera和Twitter将Parquet带入Hadoop领域

Cloudera与Twitter携手合作,为Hadoop开源了一种新的列式存储格式,称为Parquet。

二人说,由 Github托管的项目 旨在为 Hadoop生态系统的任何齿轮部分 提供“ 压缩的,高效的列式数据表示”,这意味着Parquet与语言和数据模型无关。

像Impala和Apache Drill等新兴项目一样, Parquet大量借鉴了Google在2010年发表的研究论文 Dremel中的 想法 ,该论文率先采用了重复/定义级方法来编码嵌套数据结构。 Parquet分离了编码和压缩概念,使开发人员可以为每列指定压缩方案并在编码数据上实现运算符,而不必担心解压缩。

Hadoop的主要列数据库是HBase,但是该项目背后的团队坚持认为,该项目不是要淘汰旧的收藏夹,而是在充满活力的生态系统中提供更多选择。

Twitter的Google Analytics(分析)基础架构团队的成员 Dimitriy Ryaboy 保证说:“ Parquet可以供任何人使用 。”

“ Hadoop生态系统拥有丰富的数据处理框架,我们对发挥自己的最爱并不感兴趣。 我们认为,高效,实施良好的柱状存储基板应适用于所有框架,而无需花费大量且难以建立依赖关系。

Cloudera将在其实时查询引擎 Impala中 包括Parquet的预览 Ryaboy透露,两者合而为一,与竞争对手相比,Impala的性能提高了10倍,并且相信还有“改进的空间”。

尽管该项目显然已经开放给其他厂商参与,但Cloudera希望这个最新的项目能够为反对者铺平道路。

Hadoop同行供应商Hortonworks上个月推出了 “毒刺计划” ,解释了他们计划如何翻新HBase,并采用了另一种通往Cloudera的途径。 未来几个月内,更新旧的或重新开始是否会带来红利将是很有趣的。

另一个合作伙伴,Twitter已经开始在生产中使用该工具,并将其一些主要数据源转换为Parquet的方法。 它仍在大量开发中,并在不久的将来计划了一些功能。 这包括对数据仓库系统Hive和Hadoop的抽象层Cascading(由Criteo提供)的支持,以及对已经存在的Pig支持的改进。

团队欢迎对Parquet的反馈,并计划将其提交给Apache Incubator,以期在其背后建立一个社区。

图片由MôsieurJ. [8.0版]提供


翻译自: https://jaxenter.com/cloudera-and-twitter-bring-parquet-to-the-hadoop-floor-105802.html

相关文章:

  • 2022-01-02
  • 2021-12-01
  • 2021-08-09
  • 2021-10-04
  • 2021-07-07
  • 2021-04-14
  • 2021-10-20
  • 2021-06-30
猜你喜欢
  • 2021-09-29
  • 2021-09-22
  • 2021-08-18
  • 2021-11-11
  • 2021-09-26
  • 2021-09-23
  • 2022-01-06
相关资源
相似解决方案