【发布时间】:2018-07-14 05:31:07
【问题描述】:
我有一个带有“最终”阶段的线性管道,每秒输出大约 200k 个元素(短字符串)。
但是,当我在该阶段 (myPCollection.apply(Distinct.<String>create());) 之后添加 Distinct 操作时,Distinct 之前的阶段速度下降到每秒处理的大约 80k 个元素。
但是,我正在处理一个没有最大工作人员数量的有界集合,因此我希望 Dataflow 能够自动增加工作人员的数量以匹配工作负载。不仅不会发生这种情况,而且当我手动启动具有许多工作人员(20 多名)的管道时,它会自动缩减为几个工作人员。
如何使 Dataflow 升级工作器池,以便此 Distinct 操作不会显着降低管道的处理速率?
【问题讨论】:
标签: performance google-cloud-dataflow apache-beam autoscaling