【发布时间】:2019-12-20 15:04:08
【问题描述】:
我已经设置了一个谷歌数据流模板流作业,我试图将每条消息从 GCS 推送到 pubsub。该作业不会自动缩放,并且在读取一些 GB 文件后会出现内存不足异常。我想从 GCS 读取超过 5 TB 的数据。奇怪的是,这项工作并没有停止并继续阅读,但由于内存异常,我无法确定它是否阅读了所有记录。有人可以帮忙吗?
【问题讨论】:
-
向我们展示您尝试过的代码。没有它,几乎不可能提供帮助。
-
您使用的是流版本还是批处理版本的模板?流版本使用 .关注新文件。此外,您的 GCS 存储桶中是否有数万个或更多文件,或者少量非常大的文件?
-
我正在使用流式传输管道,它在 gcs 存储桶中有很多小文件。所有文件的总大小超过 5 TB。是的,它会观察 10 秒,但在这种情况下,新文件的出现频率较低,但我必须处理存储桶中已经存在的大量历史文件,这就是我收到此错误的时候。它没有示例代码,因为它只是使用 GCP 控制台中给出的模板。
标签: google-cloud-platform google-cloud-dataflow autoscaling