【发布时间】:2021-08-22 09:23:41
【问题描述】:
假设我们有许多带有多个工作表的excel文件,如下文件data1.xlsx:
表 1:2021_q1_bj
a b c d
0 1 2 23 2
1 2 3 45 5
表 2:2021_q2_bj
a b c d
0 1 2 23 6
1 2 3 45 7
表 3:2019_q1_sh
a b c
0 1 2 23
1 2 3 45
表 4:2019_q2_sh
a b c
0 1 2 23
1 2 3 40
我需要获取每张工作表的工作表名称,然后将它们拆分为_,将第一部分存储为year,将第二部分存储为quarter,最后一部分存储为city。
最后,我会将它们保存回带有多张工作表的 excel 文件。
即,对于第一张纸:
a b c d year quarter city
0 1 2 23 2 2021 q1 bj
1 2 3 45 5 2021 q1 bj
2 1 2 23 6 2021 q1 bj
3 2 3 45 7 2021 q1 bj
如何在 Python 中实现这一点?谢谢。
循环所有的excel文件:
base_dir = './'
file_list = os.listdir(base_dir)
for file in file_list:
if '.xlsx' in file:
file_path = os.path.join(file_path, )
dfs = pd.read_excel()
【问题讨论】:
-
with
sheet_name=None,pandas.read_excel将文件中的所有工作表读取到数据帧的字典中,其中工作表名称是字典键。鉴于此,循环遍历所有文件并在循环中执行此操作应该很容易。
标签: python-3.x pandas dataframe