【问题标题】:How to do a repartitionByCassandraReplica or joinWithCassandraTable with the pyspark embedded with DSE?如何使用嵌入 DSE 的 pyspark 执行 repartitionByCassandraReplica 或 joinWithCassandraTable?
【发布时间】:2016-02-11 06:31:02
【问题描述】:

如何使用嵌入 DSE(datastax-entreprise 4.8)的 pyspark 执行 repartitionByCassandraReplica 或 joinWithCassandraTable?

【问题讨论】:

    标签: apache-spark cassandra pyspark datastax-enterprise


    【解决方案1】:

    首先,reparttionByCassandraReplica 仅适用于 RDD,而不适用于 DataFrame(因此不适用于 pySpark)。

    joinWithCassandraTable 假设 DataFrame 无法将连接下推到 Cassandra(因此对于 pySpark 是不可能的)。

    有时,使用纯 Scala 代码执行 Spark 作业仍然是进行优化和执行连接和谓词下推的最佳方式。

    【讨论】:

    猜你喜欢
    • 2021-02-13
    • 1970-01-01
    • 2020-11-12
    • 2018-02-20
    • 1970-01-01
    • 2015-03-11
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多