【问题标题】:Show how a parquet file is replicated and stored on HDFS展示如何在 HDFS 上复制和存储 parquet 文件
【发布时间】:2017-01-07 17:09:31
【问题描述】:

以 parquet 格式存储的数据会在 HDFS 上生成一个包含许多小文件的文件夹。

有没有办法查看这些文件是如何在 HDFS 中复制的(在哪些节点上)?

提前致谢。

【问题讨论】:

    标签: apache-spark hdfs parquet


    【解决方案1】:

    如果我正确理解您的问题,您实际上想要跟踪哪些数据块位于哪个数据节点上,而这不是 apache-spark 特定的。

    您可以使用 hadoop fsck 命令如下:

    hadoop fsck <path> -files -blocks -locations    
    

    这将打印出指定路径中每个块的位置。

    【讨论】:

      猜你喜欢
      • 2021-07-03
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-04-29
      • 1970-01-01
      • 2014-11-12
      • 2018-03-31
      相关资源
      最近更新 更多