【发布时间】:2016-06-20 12:56:15
【问题描述】:
我是 Spark 的新手,想在与 Cassandra 合作时了解更多关于它的操作。
大部分教程都提醒我进行服务器端过滤,我完全理解这样做的重要性。
然而,这些教程要么基于 Scala,要么基于 pyspark_cassandra,而且都没有使用 PySpark。
只是好奇下面的 scriptlet 是否在进行服务器端过滤。
给定一个 SparkConf 对象conf:
sc = pyspark.SparkContext(conf=conf)
sqlContext = SQLContext(sc)
df = (sqlContext.read.format("org.apache.spark.sql.cassandra")
.options(keyspace="ks", table="tbl").load())
df.filter("id = 1234").show()
此外,在这种情况下,我是否将整个表加载到我的 spark 集群中进行过滤?
【问题讨论】:
标签: python apache-spark cassandra pyspark apache-spark-sql