【问题标题】:Parquet and Data DuplicationParquet 和数据复制
【发布时间】:2016-01-19 10:31:53
【问题描述】:

这是因为 parquet 文件使 OLAP 查询更快,因为它是列格式,但另一方面,datalake 是重复的(原始数据 + parquet 数据)。 就算parquet可以压缩,你不觉得复制所有的数据会很费钱吗?

【问题讨论】:

    标签: hadoop parquet


    【解决方案1】:

    这取决于您的用例。如果您出于各种原因需要数据,例如暂存数据和查询,则可能需要复制。

    Parquet 最适合查询,尤其是经常只涉及特定列的 OLAP 查询。同时,编写 Parquet 文件比其他文件花费更多的时间。

    简而言之,如果您的两个数据都是 OLAP 查询的目标,您可能需要考虑仅使用 Parquet 版本的文件。

    请参阅此文档以供参考。 http://www.slideshare.net/StampedeCon/choosing-an-hdfs-data-storage-format-avro-vs-parquet-and-more-stampedecon-2015?qid=697d8f63-e6d8-4db1-951d-0f6f3b170ad1&v=default&b=&from_search=2

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-05-07
      • 1970-01-01
      • 1970-01-01
      • 2022-06-10
      相关资源
      最近更新 更多