【发布时间】:2017-08-04 04:24:49
【问题描述】:
我正在使用“学习火花流”一书来学习火花流。在这本书中,我在讨论 Dstream、RDD、块/分区的部分中找到了以下内容。
最后,在此架构中忽略的一个重要点是 Receiver 接口还可以选择连接到提供数据片段集合(想想数组)的数据源。例如,这在某些反序列化用途中尤为重要。在这种情况下,Receiver 不会通过块间隔等待来处理将数据分割成分区,而是认为整个集合反映了数据分割成块,并为集合的每个元素创建一个块。此操作对数据生产者的部分要求很高,因为它要求它以块间隔与批次间隔的比率生产块以可靠地运行(在每个批次上交付正确数量的块)。但有些人发现它可以提供卓越的性能,提供一种能够快速使许多块可用于序列化的实现。
我一直在摸索,不能简单地理解作者在说什么,尽管我觉得我应该理解它。有人可以给我一些指示吗?
【问题讨论】:
标签: apache-spark spark-streaming