【发布时间】:2020-11-11 23:17:30
【问题描述】:
我正在从 Parquet 数据源实现一些 Spark 结构化流转换。为了将数据读入流式 DataFrame,必须指定模式(不能自动推断)。架构非常复杂,手动编写架构代码将是一项非常复杂的任务。
你能建议一个绕行吗?目前我正在预先创建一个批处理 DataFrame(使用相同的数据源),Spark 推断架构,然后我将架构保存到 Scala 对象并将其用作结构化流读取器的输入。
我不认为这是一个可靠或性能良好的解决方案。请建议如何自动生成架构代码或以某种方式将架构保存在文件中并重用它。
【问题讨论】:
标签: apache-spark apache-spark-sql spark-streaming spark-structured-streaming delta