【问题标题】:Databricks structured streaming with Snowflake as source?以雪花为源的 Databricks 结构化流式传输?
【发布时间】:2020-06-04 04:52:42
【问题描述】:

是否可以使用 Snowflake 表作为 Databricks 中 Spark 结构化流的源?当我运行以下 pyspark 代码时:

    options = dict(sfUrl=our_snowflake_url,
              sfUser=user,
              sfPassword=password,
              sfDatabase=database,
              sfSchema=schema,
              sfWarehouse=warehouse)

    df = spark.readStream.format("snowflake") \
              .schema(final_struct) \
              .options(**options) \
              .option("dbtable", "BASIC_DATA_TEST") \
              .load()

我收到此警告:

java.lang.UnsupportedOperationException: 数据源雪花不支持流式读取

我无法在 Spark Structured Streaming Docs 中找到任何明确表示支持 Snowflake 作为来源的内容,但我想确保我没有遗漏任何明显的内容。

谢谢!

【问题讨论】:

  • 雪花如何将数据流式传输出去?推出一段数据的触发因素是什么?
  • 好的,看起来您可以在雪花docs.snowflake.net/manuals/user-guide/streams.html 中有效地启用 CDC,然后您需要一个外部进程来检查更改的数据并将其输出。这是实现流式传输的一种非常复杂的方式。我怀疑利用任何加载数据并从中流式传输的东西会更有意义。

标签: apache-spark pyspark spark-structured-streaming snowflake-cloud-data-platform azure-databricks


【解决方案1】:

Spark Snowflake 连接器目前不支持使用来自 Spark Structured Streaming 的 .writeStream/.readStream 调用

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-07-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-05-27
    • 2021-03-17
    • 1970-01-01
    相关资源
    最近更新 更多