【发布时间】:2016-03-24 12:18:25
【问题描述】:
我是 Spark 的新手,正在尝试结合 Cassandra 和 Spark 来完成一些分析任务。
从 Spark web UI 我发现大部分时间都消耗在阅读过程中。
当我深入研究这个特定任务时,我发现只有一个执行者在处理它。
是否可以通过并行化等技巧来提高此任务的性能?
附言我正在使用 pyspark cassandra 连接器 (https://github.com/TargetHolding/pyspark-cassandra)。
更新:我正在使用一个运行 Spark 1.6 的 3 节点 Spark 集群和一个运行 Cassandra 2.2.4 的 3 节点 Cassandra 集群。 我正在以
的形式选择数据"select * from tbl where partitionKey IN [pk_1,pk_2,....,pk_N] where clusteringKey > ck_1 和 clusteringKey
UPDATE2:我读过一篇文章,建议用并行读取替换 IN 子句。 (https://ahappyknockoutmouse.wordpress.com/2014/11/12/246/) 如何在 spark 中实现?
【问题讨论】:
-
您能否提供有关集群的更多详细信息,例如节点数、资源以及您使用的集群管理器?
标签: apache-spark cassandra pyspark