【问题标题】:Hadoop's own Serialization and its relationship with AVRO serialization?Hadoop自身的Serialization及其与AVRO序列化的关系?
【发布时间】:2018-09-18 17:49:52
【问题描述】:

我正在尝试了解 Avro,并开始知道它是 Hadoop 使用的数据序列化框架之一。

在学习 Hadoop 的过程中,我了解到 Hadoop 使用自己的 Serlization 框架,而不是 Java 的 Serialization ,所以我在 Hadoop 中可以看到 WritableWritableComparable

现在,经过 AVRO 后,它说 Avro 用作 Serlization 框架。

因此我有点困惑。所以,当我们说 Hadoop 自己的序列化框架时,我们指的是 Avro 还是其他东西(它内置在“hadoop”本身中)。

谁能帮我理解这个?

【问题讨论】:

    标签: hadoop serialization hadoop2 avro


    【解决方案1】:

    Hadoop 可写不是 Avro,而是“其他东西”

    Avro 是一个单独的项目,它的模式模型允许嵌套结构和演变。据我所知,Hadoop 序列化没有概念架构演变。

    Thrift 是 Hadoop 项目中常见的另一种面向行的序列化格式。

    其他(列)数据存储格式包括 Parquet 和 ORC

    【讨论】:

    • 感谢您的回答。那么,这是否意味着 Hadoop 使用了它们,Hadoop 自己的序列化框架和 Avro?如果这是正确的,那么为什么 Hadoop 会使用 Avro 而不是它自己的序列化?在哪些情况下 Hadoop 会更喜欢 Avro 而不是自己的序列化机制?
    • Hadoop 内部不使用 Avro。 Hive、Spark、MapReduce 等能够通过插件和外部类读写 Avro 数据
    猜你喜欢
    • 1970-01-01
    • 2017-03-29
    • 1970-01-01
    • 2012-02-05
    • 1970-01-01
    • 1970-01-01
    • 2021-06-17
    • 1970-01-01
    • 2013-06-27
    相关资源
    最近更新 更多