【发布时间】:2021-06-08 16:15:04
【问题描述】:
我找到了从 Spark 读取 HDF5 文件的工具,但不是用于编写它们的工具。有可能吗?
我们有一个 10-40TB 大小的数据集。我们目前将其写成大约 20,000 个 Python pickle 文件。这不是很便携。此外,HDF5 还提供压缩功能。
我们可以编写 parquet 文件,一种方法是写出 parquet,然后将它们转换为 HDF5。但是,这种方法并不理想,因为没有一个转换工具是多线程的。
我们希望使用 HDF5,因为它在科学界得到了广泛的认可。它在 Matlab 和 Stata 等程序中的支持似乎明显优于 parquet。
【问题讨论】:
-
为什么特别是 HDF5?为什么不是镶木地板?
-
@mck 我已经在问题中解释过了。感谢您的提问。
标签: apache-spark hdf5