【发布时间】:2022-01-22 02:19:45
【问题描述】:
假设我有两个非常大的 hdf 文件,我将读取它们并连接它们。
data = pd.concat([
pd.read_hdf("file1.hdf", key='data'),
pd.read_hdf("file2.hdf", key='data')
])
假设每个文件占用 10G 内存,而我们知道,上面的代码将占用 40g的峰值内存使用。但问题是我的电脑内存只有 32g,不知道有没有什么好的方法可以读取它们并concat inplace so peak 内存使用量为 20g?
【问题讨论】: