【发布时间】:2021-07-02 00:18:32
【问题描述】:
我有一个很大的 JSON,想在 Spark Structured Streaming 中使用。我不想手动将此 JSON 重新键入为 Spark 模式表达式。我可以自动执行一次吗?
这是我写的
from pyspark.sql import SparkSession
spark = SparkSession \
.builder \
.appName("Infer Schema") \
.getOrCreate()
df = spark \
.read \
.option("multiline", True) \
.json("file_examples/dataflow/row01.json")
df.printSchema()
df.show()
with open("dataflow_schema.json", "w") as fp:
fp.write(df.schema.json())
这样好吗?
【问题讨论】:
-
我添加了一个带有一些 kafka 注释的示例,如果这对你有用,请告诉我
标签: json apache-spark pyspark spark-structured-streaming