【发布时间】:2020-06-04 04:52:42
【问题描述】:
是否可以使用 Snowflake 表作为 Databricks 中 Spark 结构化流的源?当我运行以下 pyspark 代码时:
options = dict(sfUrl=our_snowflake_url,
sfUser=user,
sfPassword=password,
sfDatabase=database,
sfSchema=schema,
sfWarehouse=warehouse)
df = spark.readStream.format("snowflake") \
.schema(final_struct) \
.options(**options) \
.option("dbtable", "BASIC_DATA_TEST") \
.load()
我收到此警告:
java.lang.UnsupportedOperationException: 数据源雪花不支持流式读取
我无法在 Spark Structured Streaming Docs 中找到任何明确表示支持 Snowflake 作为来源的内容,但我想确保我没有遗漏任何明显的内容。
谢谢!
【问题讨论】:
-
雪花如何将数据流式传输出去?推出一段数据的触发因素是什么?
-
好的,看起来您可以在雪花docs.snowflake.net/manuals/user-guide/streams.html 中有效地启用 CDC,然后您需要一个外部进程来检查更改的数据并将其输出。这是实现流式传输的一种非常复杂的方式。我怀疑利用任何加载数据并从中流式传输的东西会更有意义。
标签: apache-spark pyspark spark-structured-streaming snowflake-cloud-data-platform azure-databricks