【发布时间】:2020-01-27 22:02:59
【问题描述】:
下面是我的 s3 存储桶文件夹结构的样子,
s3://s3bucket/folder1/morefolders/$folder_which_I_want_to_pick_latest/
$folder_which_I_want_to_pick_latest - 对于每个新进入的文件夹,此文件夹始终可以有一个递增的数字,例如 randomnumber_timestamp
有没有一种方法可以通过始终从 Scala 中的 spark 读取 s3 中的最新文件夹来自动执行此过程
【问题讨论】:
-
不投票结束,但这可能是一个答案:stackoverflow.com/questions/50526076/find-latest-file-pyspark
-
可能是选择最新文件的一个很好的例子,但我正在寻找其中包含文件的最新文件夹作为镶木地板。我也需要 scala 解决方案
标签: scala amazon-web-services apache-spark amazon-s3