【问题标题】:Identifying missing files in S3 that are not downloaded from FTP识别 S3 中未从 FTP 下载的丢失文件
【发布时间】:2021-10-13 06:55:13
【问题描述】:

我有一些 Python 代码,它从 FTP 下载一些文件并将它们写入 AWS S3 存储桶。现在我想避免任何丢失的文件,所以我目前的做法是:

-> 列出 FTP 中所有可用的文件,将文件名添加到列表中list_1 -> 列出 S3 存储桶中的所有文件,将文件名添加到列表中list_2 -> 然后比较list_1list_2,找出没有下载到s3的丢失文件 -> 下载那些丢失的文件。

问题是这些代码需要每小时运行一次,而且 FTP 中有很多文件,所以第一步(列出 FTP 中的文件名)需要很长时间才能运行(我有一个单独的问题为此:link)。有没有人有其他更好的想法来改进这个逻辑并且执行起来可能更快?

【问题讨论】:

    标签: python amazon-web-services amazon-s3 ftp


    【解决方案1】:

    请参阅How to check for change in the directory at FTP server? => 没有比您目前正在做的更好的方法了。

    唯一可能的优化是如果您的服务器支持-t 切换到LIST 命令,您可以使用它来获取按修改时间排序的文件列表。 请参阅How to get files in FTP folder sorted by modification time(PHP 问题,但仍然相关)。

    您可以在遇到第一个文件时中止列表,该文件已经在 S3 中。当然这只是真的,如果你只想上传新文件,而不是任何文件(甚至是旧文件)添加到 FTP。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-08-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多