【发布时间】:2020-02-18 02:44:15
【问题描述】:
我目前正在开发一个 Pyspark 应用程序,以将每日 delta 提取物输出为镶木地板。这些文件将是一个单独的分区(自然分区将在数据创建/更新的日期,这就是它们的构建方式)。
我打算然后获取输出的 parquet 文件夹和文件,重命名实际 parquet 文件本身,将其移动到另一个位置并丢弃原始的 *.parquet 目录,包括其 _SUCCESS 和 *.crc 文件。
虽然我已经使用 Spark 和 Pandas 测试了使用上述场景生成的读取文件,但我不确定这是否会导致我们将来可能引入的其他应用程序出现问题。
任何人都可以看到上述方法的任何实际问题(除了处理/编码工作)吗?
谢谢
【问题讨论】:
标签: pandas apache-spark pyspark parquet