【发布时间】:2022-01-12 19:01:37
【问题描述】:
使用 python,我应该去 cwp 文件夹并进入 date 文件夹并读取 parquet 文件。 我在 s3 中有这个文件夹结构。
示例 s3 路径:
存储桶名称 = lla.analytics.dev
路径 = bigdata/dna/fixed/cwp/dt=YYYY-MM-DD/file.parquet
s3://lla.analytics.dev/bigdata/dna/fixed/cwp/dt=2021-11-24/file.parquet
dt=2021-11-25/file.parquet
dt=2021-11-26/file.parquet
........................
........................
dt=YYYY-MM-DD/file.parquet
我应该访问最近的日期文件夹并将文件从 s3 读入数据帧
【问题讨论】:
-
你的熊猫版本是什么? (
pd.__version__) -
它是版本 1.3.4 @user17242583
-
尝试在调用
fp_obj.to_pandas()之前添加这两行:import pandas和print(pandas.__version__) -
在
df = fp_obj.to_pandas()行之前添加。 -
@Corralien 你能帮我解决这个问题吗?
标签: python pandas dataframe pyarrow fastparquet