【发布时间】:2023-03-11 10:35:02
【问题描述】:
我有这种情况。我们必须提供一个可以接受任何类型的RDD 的功能,使用泛型表示法,您可以说RDD[T] 并使用Avro DataFile 序列化并保存到HDFS。
注意 RDD 可以是任何东西,因此功能应该是给定 RDD 类型的通用,例如,RDD[(String, AnyBusinessObject)] o RDD[(String, Date, OtherBusinessObject)]。
问题是:我们如何推断 Avro 架构 并为任何类类型提供 Avro 序列化 以便将其保存为 Avro 数据文件?
这个功能其实已经构建好了,但是它使用了Java序列化,这显然会造成空间和时间的损失,所以我们想对其进行重构。我们不能使用 DataFrame。
【问题讨论】:
标签: apache-spark hadoop serialization avro