【发布时间】:2017-01-07 17:09:31
【问题描述】:
以 parquet 格式存储的数据会在 HDFS 上生成一个包含许多小文件的文件夹。
有没有办法查看这些文件是如何在 HDFS 中复制的(在哪些节点上)?
提前致谢。
【问题讨论】:
标签: apache-spark hdfs parquet
以 parquet 格式存储的数据会在 HDFS 上生成一个包含许多小文件的文件夹。
有没有办法查看这些文件是如何在 HDFS 中复制的(在哪些节点上)?
提前致谢。
【问题讨论】:
标签: apache-spark hdfs parquet
如果我正确理解您的问题,您实际上想要跟踪哪些数据块位于哪个数据节点上,而这不是 apache-spark 特定的。
您可以使用 hadoop fsck 命令如下:
hadoop fsck <path> -files -blocks -locations
这将打印出指定路径中每个块的位置。
【讨论】: