【发布时间】:2015-02-02 10:59:27
【问题描述】:
我有一个 3.374Gb npz 文件,myfile.npz。
我可以读入并查看文件名:
a = np.load('myfile.npz')
a.files
给予
['arr_1','arr_0']
我可以在“arr_1”中阅读正常
a1=a['arr_1']
但是,我无法加载 arr_0,或读取其形状:
a1=a['arr_0']
a['arr_0'].shape
以上两种操作都报错:
ValueError: array is too big
我有 16Gb RAM,其中 8.370Gb 可用。所以问题似乎与内存无关。我的问题是:
我应该能够读取这个文件吗?
谁能解释这个错误?
我一直在考虑使用
np.memmap来解决这个问题 - 这是一种合理的方法吗?我应该使用什么调试方法?
编辑:
我可以访问具有更多 RAM (48GB) 的计算机并加载它。 dtype 实际上是 complex128,a['arr_0'] 的未压缩内存是 5750784000 字节。似乎可能需要 RAM 开销。那个或我预测的可用 RAM 量是错误的(我使用了 windows sysinternals RAMmap)。
【问题讨论】:
-
我怀疑您无法加载它的原因是,例如,将 3.4 表示为计算机内存中的浮点数比将 3.4 保存在磁盘上需要更多的内存。但与开始阅读之前相比,我不太确定。
-
你知道文件是否被压缩(它是使用
np.savez_compressed()创建的)吗?您是否在尝试加载它的同一台机器上创建它?你知道它包含什么样的数组(大小和dtype)吗? -
@ali_m,是的,是用
np.savez_compressed保存的,但保存在不同的机器上。arr_0是形状(200,1440,3,12,32)的浮动(我认为是 8 字节),arr_1是 (200,3,32) 再次浮动。 -
尝试将
mmap_mode='r'作为np.load的附加参数。这不应该将数组加载到内存中,而是将它们保存在磁盘上。除非您之后将其复制到另一个数组。 -
@Wicket 不适用于包含多个数组的
.npz文件(至少在我的机器上)。当您实际尝试使用a['x']访问其中一个数组时,无论您是否指定mmap_mode=,整个内容都将作为标准np.array而不是np.memmap读入内存。