【发布时间】:2020-07-28 20:52:39
【问题描述】:
我有一个包含 string 和 int 列的 spark 数据框。
但是当我将数据框写入 csv 文件并稍后加载时,所有列都作为字符串加载。
from pyspark.sql import SparkSession
spark = SparkSession.builder.enableHiveSupport().getOrCreate()
df = spark.createDataFrame([("Alberto", 2), ("Dakota", 2)],
["Name", "count"])
之前:
df.printSchema()
输出:
root
|-- Name: string (nullable = true)
|-- count: long (nullable = true)
df.write.mode('overwrite').option('header', True).csv(filepath)
new_df = spark.read.option('header', True).csv(filepath)
之后:
new_df.printSchema()
输出:
root
|-- Name: string (nullable = true)
|-- count: string (nullable = true)
如何在编写时指定存储模式?
【问题讨论】:
标签: apache-spark pyspark