【发布时间】:2020-10-05 07:28:33
【问题描述】:
根据 Apache Flink 文档,KeyBy 转换在逻辑上将流划分为不相交的分区。具有相同键的所有记录都分配到同一个分区。
KeyBy 是 100% 逻辑转换吗?它不包括跨集群节点分布的物理数据分区吗?如果是这样,那么如何保证所有具有相同key的记录都分配到同一个分区?
例如,假设我们从 n 个节点的 Apache Kafka 集群获取分布式数据流。运行我们的流式作业的 Apache Flink 集群由 m 个节点组成。当 keyBy 转换应用于传入的数据流时,它如何保证逻辑数据分区?还是涉及跨集群节点的物理数据分区?
我似乎对逻辑数据分区和物理数据分区感到困惑。
【问题讨论】:
标签: apache-flink distributed-computing flink-streaming data-partitioning