【发布时间】:2021-06-23 15:59:33
【问题描述】:
我从 pandas 创建了一个数据框,并使用 to_parquet(...) 直接写入 s3。
参数是:
df.to_parquet('s3://bucket/fn.parquet', compression='gzip', engine='fastparquet', partition_cols=['col1'])
当我使用 pandas 的 pandas.read_parquet(url) 时,数据帧加载正常。
但是当我使用modin.pandas.read_parquet(url) 时,出现以下错误:
File "/home/mguo/anaconda3/envs/testenv/lib/python3.7/site-packages/s3fs/core.py", line 1779, in __init__
self.req_kw["IfMatch"] = self.details["ETag"]
KeyError: 'ETag'
以下是我的版本:
python==3.7.3
pandas==1.2.4
modin==0.10.0
s3fs==2021.6.0
【问题讨论】:
-
嗨!你解决过这个问题吗?从 S3 读取镶木地板文件夹时,我遇到了同样的问题,尽管我使用的是 pyarrow 而不是 fastparquet。我看到你引用的这个问题已经关闭,所以我不知道你是否找到了解决方案。 github.com/modin-project/modin/issues/3185
-
嘿,不幸的是,我转向了不同的解决方案(即不使用 modin)。我可以回去检查是否正在工作。
标签: python dataframe amazon-s3 parquet modin