【发布时间】:2019-07-30 14:08:31
【问题描述】:
我正在尝试使用 Spark Structured Streaming 从 Kafka 获取数据。
我希望输出文件大小约为 20 MB。
由于我在从 Kafka 读取时使用 latest 作为 startingoffset 选项,因此大多数文件的大小约为 230 KB。
如何使所有输出文件大于超过 20MB?
我什至将maxpffsetpertrigger 选项用作100000000,它不起作用。
【问题讨论】:
-
我认为这个问题类似于“从一个主题中读取多少条记录才能达到 20MB 大小”?你会怎么做?我认为,如果您可以在 Kafka 本身(使用 Kafka Consumer API)中做到这一点,那么 Spark 中也可能有一种方法。不过我怀疑这是可能的。
-
@JacekLaskowski 当我使用
latest选项时,最初获取的数据小于 1MB,但很快,数据将大于 10MB。有些数据大于 30MB。而且我猜,是因为maxoffsetpertrigger=10000000,但是数据变大需要一些时间。
标签: apache-spark apache-kafka spark-structured-streaming