【发布时间】:2018-05-14 16:27:36
【问题描述】:
我的 Dataflow 管道的第一步是从存储在 bigquery 上的表中读取数据。我使用 Apache Beam Python SDK 2.3.0 并将此步骤定义为:
p | "Read Table" >> beam.io.Read(beam.io.BigQuerySource(query=query))
我的查询只是从表中读取一些列,根本没有过滤或处理值。
我的表总共包含大约 275 GB 的数据,但是我的管道报告此步骤输出接近 650 GB 的数据。为什么数据量这么大?
【问题讨论】:
标签: python google-cloud-dataflow apache-beam