【发布时间】:2020-06-06 14:58:35
【问题描述】:
我正在构建一个更改数据捕获管道,它从 MYSQL 数据库读取数据并在 BigQuery 中创建一个副本。我将推送 Pub/Sub 中的更改并使用 Dataflow 将它们传输到 Google Cloud Storage。我已经能够弄清楚如何流式传输更改,但我需要对我的数据库中的一些表运行批处理。
在从 Pub/Sub 等无限源读取数据时,能否使用 Dataflow 运行批处理作业?我可以运行此批处理作业将数据从 Pub/Sub 传输到 Cloud Storage,然后将此数据加载到 BigQuery 吗?我想要批处理作业,因为流作业成本更高。
【问题讨论】:
-
您每天使用 Dataflow 为每个表生成多少个文件?您的 MySQL 数据库是否在 Cloud SQL 上?您可以接受 MySQL 更新(以及 PubSub 消息发布)和 BigQuery 中可用数据的延迟时间?
-
1.我有点困惑,你在说什么文件?每个表在 PubSub 中都有一个对应的主题,在 Dataflow 中有一个对应的作业。 2. 数据库托管在 Amazon RDS 上。 3. 由于这是一个批处理过程,我将每周运行一次。所以这个延迟可能很大,因为我不想实时流式传输这些变化。 @guillaumeblaquiere
-
是否可以完全不涉及 GCS,直接将数据从 PubSub 发送到 BQ,而是作为批处理作业而不是流作业?
标签: google-bigquery google-cloud-storage batch-processing google-cloud-pubsub dataflow