【发布时间】:2020-06-26 12:11:11
【问题描述】:
哪个选项使用 pyspark 提供最佳性能?使用地图进行 UDF 或 RDD 处理?
我正在使用 spark 结构化流处理数据,对于每个微批次,我将 DF 转换为 RDD,并执行一些 python graphkit 操作,然后再次将 RDD 转换为 DF 以写入 Kafka 流。
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql rdd spark-structured-streaming