【发布时间】:2019-07-07 06:30:46
【问题描述】:
我在 jupyter 笔记本上。
我想使用查询 dsl 来准备初始数据框。
我为此使用conf.set("es.query", dsl_query)。 (https://www.elastic.co/guide/en/elasticsearch/hadoop/current/configuration.html#_querying)
但是,我想应用不同的查询来准备另一个 Dataframe,但我找不到在不创建新 SparkContext 的情况下应用新 dsl_query 的方法
但我也没有找到在 jupyter 环境中重新创建 SparkContext 的方法。
我想使用 QueryDSL-1 作为基线运行分析 然后使用 QueryDSL-2 作为另一个基线运行另一个分析
有没有办法在不创建两个笔记本的情况下做到这一点?
【问题讨论】:
-
你不需要在你的 spark conf 中定义查询...
-
您可以将 es.query 指定为 DataFrameReader 的选项,即
spark.read.option("es.query", dsl_query).option("...", "...")... -
是的,它有效,你能把它作为答案,所以我可以接受
标签: apache-spark elasticsearch pyspark elasticsearch-hadoop