【问题标题】:Spark binary data source vs sc.binaryFilesSpark 二进制数据源与 sc.binaryFiles
【发布时间】:2020-06-26 12:23:45
【问题描述】:

Spark 3.0 允许使用新的data source 读取二进制数据:

val df = spark.read.format(“binaryFile”).load("/path/to/data")

使用以前的 spark 版本,您可以使用以下方式云加载数据:

val rdd = sc.binaryFiles("/path/to/data")

除了可以选择使用高级 API (Dataset) 访问二进制数据之外,Spark 3.0 还通过此功能引入了哪些其他好处或功能?

【问题讨论】:

    标签: scala apache-spark binary-data spark3


    【解决方案1】:

    我认为除了开发人员使用高级 API(Dataframe/Dataset)比低级(RDD)对数据有更多的控制权之外,我认为没有任何额外的好处,而且他们不需要担心性能,因为它经过了很好的优化/管理自己的高级 API。

    参考 - https://spark.apache.org/docs/3.0.0-preview/sql-data-sources-binaryFile.html

    附: - 我确实认为我的回答不符合正式回答的条件。我之前只想将其添加为评论但无法这样做,因为我还没有获得评论的特权.. :)

    【讨论】:

    • 感谢您的回答。我希望有一份正式的文档来讨论差异、新格式的实际代码或测试来解释这一点。
    • 我发现你无法像以前的版本那样控制并行性,这让我很困惑。
    猜你喜欢
    • 1970-01-01
    • 2016-10-31
    • 1970-01-01
    • 2021-09-18
    • 1970-01-01
    • 2011-10-14
    • 1970-01-01
    • 2020-06-06
    • 2011-10-06
    相关资源
    最近更新 更多