【发布时间】:2019-12-02 19:47:48
【问题描述】:
我正在尝试读取存储在 hdfs 中的文本文件中的架构,并在创建 DataFrame 时使用它。
schema=StructType([
StructField("col1",StringType(),True),
StructField("col2",StringType(),True),
StructField("col3",TimestampType(),True),
StructField("col4",
StructType([
StructField("col5",StringType(),True),
StructField("col6",
.... and so on
jsonDF = spark.read.schema(schema).json('/path/test.json')
由于架构太大,我想在代码中定义。谁能建议最好的方法。
我尝试了以下方法但不起作用。
schema = sc.wholeTextFiles("hdfs://path/sample.schema"))
schema = spark.read.text('/path/sample.schema')
【问题讨论】:
标签: python-3.x pyspark