【发布时间】:2020-04-10 02:15:54
【问题描述】:
我成功地创建了一个单帧/行并使用以下方法以镶木地板格式写入 s3
data_for_frame = [{"Category": 'Category A', "ID": 1, "Value": Decimal(12.40)},
{"Category": 'Category B', "ID": 2, "Value": Decimal(30.10)},
{"Category": 'Category C', "ID": 3, "Value": Decimal(100.01)}
]
dynamic_frame = sparkSession.createDataFrame(data_frame, schema_frame)
frame = sparkSession.createDataFrame(data_frame, schema_frame)
frame.write.parquet(s3_path)
如何一次写入多行以最小化每次写入?意味着我创建了多行并以某种方式将一个大帧传递给一次写入 s3
我试图将多个帧放入一个列表中,然后将其传递给frame.write,但这不适用于错误AttributeError: 'list' object has no attribute 'write'
此外,如果我尝试使用单个帧在循环中写入 s3,则会出现错误
AnalysisException: 'path s3://stackoverflow-test-bucket/testing/default_bucket/year=2020/month=4/day=4 already exists.;'
【问题讨论】:
标签: python-3.x apache-spark pyspark parquet