【发布时间】:2015-08-22 06:47:44
【问题描述】:
我有一个云数据流作业,它为 appengine 应用程序执行大量处理。在管道的一个阶段,我按特定键进行分组,对于与该键匹配的每条记录,我想将文件写入 Cloud Storage(使用该键作为文件名的一部分)。
我事先不知道这些记录会有多少。所以这种使用模式不符合标准的云数据流数据接收器模式(输出阶段的分片决定了#个输出文件,我无法控制每个分片的输出文件名)。
我正在考虑直接写入云存储作为 ParDo 函数的副作用,但有以下疑问:
- 是否允许将写入云存储作为副作用?
- 如果我是从数据流管道外部编写的,似乎我应该将 Java 客户端用于 JSON 云存储 API。但这涉及通过 OAUTH 进行身份验证以执行任何工作:对于已经在 GCE 机器上作为数据流管道的一部分运行的工作,这似乎不合适:这可行吗?
感谢您的任何建议。
【问题讨论】:
标签: google-cloud-storage google-cloud-dataflow