【发布时间】:2021-06-03 23:20:08
【问题描述】:
我有两个数据源,它们都有相同的列,即 id, product_name 以 csv 和 json 文件的形式出现。我希望将这两个数据帧联合起来,并将它们写在 parquet 文件中。在写出之前先强制执行模式的好方法是什么?我读到 parquet 保留了原始数据的模式,但我想在数据源有错误记录时捕获错误,例如 id 字段应该是一个 int 但有一个字符串。非常感谢您的帮助。
【问题讨论】:
-
您需要考虑 DataSet 而不是 Dataframe,因为 DataSet 可确保检查数据类型。
标签: python apache-spark pyspark apache-spark-sql parquet