【发布时间】:2017-07-12 03:02:08
【问题描述】:
我已将输入数据存储为 S3 上的单个大文件。 我希望 Dask 自动切分文件,分发给工作人员并管理数据流。因此使用分布式收集的想法,例如包。
在每个工作人员上,我都有一个命令行工具 (Java),可以从文件中读取数据。因此,我想将一整块数据写入文件,调用外部 CLI/代码来处理数据,然后从输出文件中读取结果。这看起来像是处理批量数据而不是一次记录。
解决这个问题的最佳方法是什么?是否可以在worker上将分区写入磁盘并整体处理?
PS。保留在分布式集合模型中也没有必要但可取,因为对数据的其他操作可能是更简单的 Python 函数,逐条处理数据。
【问题讨论】:
-
您好,欢迎来到 Stack Overflow,请花点时间通过 welcome tour 了解您在此处的方式(并获得您的第一个徽章),阅读如何创建 Minimal, Complete, and Verifiable example并检查How to Ask Good Questions,这样您就有机会获得反馈和有用的答案。
标签: dask dask-distributed