【发布时间】:2017-03-02 11:07:45
【问题描述】:
我有一个包含 5 亿行的 Cassandra 表。我想使用 spark 根据作为 Cassandra 中的分区键的字段进行过滤。
您能否建议基于列表键在 Spark/Spark SQL 中进行过滤的最佳可能/有效方法,该列表键也非常大。
基本上我只需要 Cassandra 表中存在于键列表中的那些行。
我们正在使用 DSE 及其功能。 我使用的方法大约需要一个小时左右。
【问题讨论】:
-
你说的大列表到底是什么意思?
-
我想加入 2 个数据集。 Cassandra 表有 500+ 百万条记录和一个键列表(即 object_id)。最终结果应该只有那些在列表中 object_id 匹配的 Cassandra 表行。我正在使用需要大量时间的连接,我想防止这种情况发生
标签: apache-spark cassandra apache-spark-sql spark-dataframe spark-cassandra-connector