【发布时间】:2020-06-26 12:23:45
【问题描述】:
Spark 3.0 允许使用新的data source 读取二进制数据:
val df = spark.read.format(“binaryFile”).load("/path/to/data")
使用以前的 spark 版本,您可以使用以下方式云加载数据:
val rdd = sc.binaryFiles("/path/to/data")
除了可以选择使用高级 API (Dataset) 访问二进制数据之外,Spark 3.0 还通过此功能引入了哪些其他好处或功能?
【问题讨论】:
标签: scala apache-spark binary-data spark3