【发布时间】:2021-11-11 14:44:43
【问题描述】:
我们使用 Python 的 boto3 库执行 start_export_task 来触发 RDS 快照导出(到 S3)。这成功地在 S3 中生成了一个具有可预测的 expected 结构的目录。通过该目录向下遍历到任何特定的表目录(如在 export_identifier/database_name/schema_name.table_name/ 中),我看到了几个 .parquet 文件。
我下载了其中几个文件并将它们转换为 pandas 数据帧,以便查看它们。它们的结构都相同,似乎显然是同一张桌子的一部分。但它们的大小范围从 100KB 到 8MB,大小似乎不可预测。表格的这些文件/“片段”是否占所有行?它们是否重复/重叠?为什么它们被如此(看似)随机分割?哪些参数控制这种分割?
最终,我正在寻找有关 parquet 文件夹/文件结构这一部分的文档。我找到了大量关于individual files are structured 和partitioning 的信息。但我认为这稍微超出了这些主题。
【问题讨论】:
标签: amazon-web-services boto3 amazon-rds parquet