【发布时间】:2016-06-11 18:10:48
【问题描述】:
在我的数据流管道中,我将有两个从 BigQuery 表中读取的 PCollections<TableRow>。我计划将这两个 PCollection 合并为一个 PCollection 和一个 flatten。
由于 BigQuery 仅追加,因此目标是使用新的 PCollection 截断 BigQuery 中的第二个表。
我已通读文档,这是我感到困惑的中间步骤。对于我的新PCollection,计划是使用Comparator DoFn 查看最大上次更新日期并返回给定行。 我不确定是否应该使用过滤器转换,或者是否应该先按键分组然后使用过滤器?
所有PCollection<TableRow>s 都将包含相同的值:IE:字符串、整数和时间戳。当谈到键值对时,大多数关于云数据流的文档都只包含简单的字符串。 是否可以有一个键值对是PCollection<TableRow> 的整行?
这些行看起来类似于:
customerID, customerName, lastUpdateDate
0001, customerOne, 2016-06-01 00:00:00
0001, customerOne, 2016-06-11 00:00:00
在上面的示例中,我希望过滤 PCollection 以仅将第二行返回到将写入 BigQuery 的 PCollection。 另外,是否可以在不创建第四个的情况下将这些 Pardo 应用于第三个 PCollection?
【问题讨论】:
标签: java google-cloud-dataflow