【问题标题】:Searching from Cassandra database via SparkStreaming takes time通过 SparkStreaming 从 Cassandra 数据库中搜索需要时间
【发布时间】:2018-12-31 22:26:26
【问题描述】:

我正在使用这一行从我的 Cassandra 数据库中获取条目

val  data1 =
  ssc.
    cassandraTable("orbigo2", "my_trips").
    select("trip_id").
    where ("user_id=?", uid)

但这需要很多时间,我猜原因是我的uid不是主键而是索引键。

有什么方法可以加快速度吗?

【问题讨论】:

    标签: apache-spark cassandra spark-streaming spark-cassandra-connector


    【解决方案1】:

    我只建议更改数据模型,以便 uid 将成为分区键 - 在这种情况下它会更快......现在它只是扫描整个表并提取必要的数据。

    另外,您可以考虑使用DataFrames 而不是RDD - 它有更多优化,也许您可​​以使用二级索引。你可以在DataFrame上用.explain查看执行计划,看看数据是如何被访问的……

    【讨论】:

      猜你喜欢
      • 2012-07-25
      • 2012-04-26
      • 1970-01-01
      • 2022-01-19
      • 1970-01-01
      • 2011-12-18
      • 1970-01-01
      • 2017-08-21
      • 1970-01-01
      相关资源
      最近更新 更多