【发布时间】:2019-06-25 06:21:30
【问题描述】:
我了解大部分 JSON SerDe 格式都希望.json 文件以每行一条记录的形式存储。
我有一个 S3 存储桶,其中包含多行缩进 .json 文件(不要控制源),我想使用 Amazon Athena 进行查询(尽管我认为这通常也适用于 Hive)。
- 是否有能够解析多行缩进
.json文件的 SerDe 格式? - 如果没有 SerDe 格式可以执行此操作:
- 是否有处理此类文件的最佳实践?
- 我是否应该计划使用其他工具(例如 python)将这些记录展平?
- 是否有编写自定义 SerDe 格式的标准方法,以便我自己编写?
- 是否有处理此类文件的最佳实践?
示例文件正文:
[
{
"id": 1,
"name": "ryan",
"stuff: {
"x": true,
"y": [
123,
456
]
},
},
...
]
【问题讨论】:
-
我没有
(py)spark有这个限制
标签: json hive amazon-athena