【问题标题】:Elasticsearch Spark, how to query multiple times?Elasticsearch Spark,如何多次查询?
【发布时间】:2019-07-07 06:30:46
【问题描述】:

我在 jupyter 笔记本上。

我想使用查询 dsl 来准备初始数据框。

我为此使用conf.set("es.query", dsl_query)。 (https://www.elastic.co/guide/en/elasticsearch/hadoop/current/configuration.html#_querying)

但是,我想应用不同的查询来准备另一个 Dataframe,但我找不到在不创建新 SparkContext 的情况下应用新 dsl_query 的方法

但我也没有找到在 jupyter 环境中重新创建 SparkContext 的方法。

我想使用 QueryDSL-1 作为基线运行分析 然后使用 QueryDSL-2 作为另一个基线运行另一个分析

有没有办法在不创建两个笔记本的情况下做到这一点?

【问题讨论】:

  • 你不需要在你的 spark conf 中定义查询...
  • 您可以将 es.query 指定为 DataFrameReader 的选项,即 spark.read.option("es.query", dsl_query).option("...", "...") ...
  • 是的,它有效,你能把它作为答案,所以我可以接受

标签: apache-spark elasticsearch pyspark elasticsearch-hadoop


【解决方案1】:

您只需将es.query 指定为DataFrameReader 的一个选项,即:

spark.read.option("es.query", dsl_query).option("...", "...")

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-02-21
    • 1970-01-01
    • 2019-01-22
    • 2016-04-22
    • 1970-01-01
    • 2019-11-13
    相关资源
    最近更新 更多