【发布时间】:2021-11-16 16:19:17
【问题描述】:
我有一个包含多个 csv 文件 (5k+) 的文件夹,要使用它们,最好使用相同的变量名和列数。但事实并非如此。
为了进行清理,我想根据它们的列创建一些子文件夹。例如,如果两个或多个 csv 具有相同的列和变量名称,则使用它们创建一个子文件夹。
到目前为止,我找到了如何组合所有文件,但我不知道将条件与匹配的列子文件夹放在哪里。
import glob
import pandas as pd
extension = 'csv'
all_filenames = [i for i in glob.glob('*.{}'.format(extension))]
col_combined_csv = pd.concat([pd.read_csv(f) for f in all_filenames])
【问题讨论】:
-
那么你想将所有具有相同标题的文件组合在一起吗?为什么需要子文件夹?只是为每个标题组合使用不同的名称?
标签: python database csv concatenation