【发布时间】:2018-07-13 16:37:07
【问题描述】:
我必须使用 pySpark 将大量文件加载到配置单元表中。有多个不同的 json 文件包含数据和定义文件数据模式的单独文件。在不传递模式的情况下加载文件时,数据列会乱序,这就是我想创建模式的原因。 Json 文件如下所示:
data: {'col1': 'ASDFG', 'col2': 'ASDXC'...
schema: {'description': 'filename', 'type': 'object', 'properties': {'col1': {'type': 'string'}, 'col2': {'type': 'string}, 'col3': {'type': 'string} ...
我的想法是将此文件作为字典读取,提取“属性”键值作为列名和数据类型,然后以某种方式生成用于将火花数据帧加载到配置单元的架构。还有其他选择吗?如果你们中的任何人遇到过这种情况,我将非常感谢您的帮助或提供一些示例。
谢谢。
【问题讨论】:
标签: python json dataframe hive pyspark