【发布时间】:2018-05-05 05:47:59
【问题描述】:
我想从我的 HDFS 目录之一获取最新更新的文件。代码基本上应该循环遍历目录和子目录,并获取带有文件名的最新文件路径。我能够在本地文件系统中获取最新文件,但不知道如何为 HDFS 执行此操作。
find /tmp/sdsa -type f -print0 | xargs -0 stat --format '%Y :%y %n' | sort -nr | cut -d: -f2- | head
以上代码适用于本地文件系统。我可以从 HDFS 获取日期、时间和文件名,但是如何使用这 3 个参数获取最新文件?
这是我尝试过的代码:
hadoop fs -ls -R /tmp/apps | awk -F" " '{print $6" "$7" "$8}'
我们将不胜感激。
提前致谢。
【问题讨论】: