【问题标题】:How do I write HDF5 files from Apache Spark?如何从 Apache Spark 写入 HDF5 文件?
【发布时间】:2021-06-08 16:15:04
【问题描述】:

我找到了从 Spark 读取 HDF5 文件的工具,但不是用于编写它们的工具。有可能吗?

我们有一个 10-40TB 大小的数据集。我们目前将其写成大约 20,000 个 Python pickle 文件。这不是很便携。此外,HDF5 还提供压缩功能。

我们可以编写 parquet 文件,一种方法是写出 parquet,然后将它们转换为 HDF5。但是,这种方法并不理想,因为没有一个转换工具是多线程的。

我们希望使用 HDF5,因为它在科学界得到了广泛的认可。它在 Matlab 和 Stata 等程序中的支持似乎明显优于 parquet。

【问题讨论】:

  • 为什么特别是 HDF5?为什么不是镶木地板?
  • @mck 我已经在问题中解释过了。感谢您的提问。

标签: apache-spark hdf5


【解决方案1】:

与 HDFGroup 协商后,我们确定目前无法直接从 Spark 写入 HDF5 文件。它们可以使用 numpy 和 pandas 从 Dask 编写,但不能从 Spark 编写。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-08-15
    • 1970-01-01
    • 2020-07-24
    • 1970-01-01
    • 2022-07-07
    • 1970-01-01
    • 2022-07-06
    • 1970-01-01
    相关资源
    最近更新 更多