【问题标题】:Why is this numpy array too big to load?为什么这个 numpy 数组太大而无法加载?
【发布时间】:2015-02-02 10:59:27
【问题描述】:

我有一个 3.374Gb npz 文件,myfile.npz

我可以读入并查看文件名:

a = np.load('myfile.npz')
a.files

给予

['arr_1','arr_0']

我可以在“arr_1”中阅读正常

a1=a['arr_1']

但是,我无法加载 arr_0,或读取其形状:

a1=a['arr_0']
a['arr_0'].shape

以上两种操作都报错:

ValueError: array is too big

我有 16Gb RAM,其中 8.370Gb 可用。所以问题似乎与内存无关。我的问题是:

  1. 我应该能够读取这个文件吗?

  2. 谁能解释这个错误?

  3. 我一直在考虑使用 np.memmap 来解决这个问题 - 这是一种合理的方法吗?

  4. 我应该使用什么调试方法?

编辑:

我可以访问具有更多 RAM (48GB) 的计算机并加载它。 dtype 实际上是 complex128a['arr_0'] 的未压缩内存是 5750784000 字节。似乎可能需要 RAM 开销。那个或我预测的可用 RAM 量是错误的(我使用了 windows sysinternals RAMmap)。

【问题讨论】:

  • 我怀疑您无法加载它的原因是,例如,将 3.4 表示为计算机内存中的浮点数比将 3.4 保存在磁盘上需要更多的内存。但与开始阅读之前相比,我不太确定。
  • 你知道文件是否被压缩(它是使用np.savez_compressed()创建的)吗?您是否在尝试加载它的同一台机器上创建它?你知道它包含什么样的数组(大小和dtype)吗?
  • @ali_m,是的,是用np.savez_compressed 保存的,但保存在不同的机器上。 arr_0 是形状 (200,1440,3,12,32) 的浮动(我认为是 8 字节),arr_1 是 (200,3,32) 再次浮动。
  • 尝试将mmap_mode='r' 作为np.load 的附加参数。这不应该将数组加载到内存中,而是将它们保存在磁盘上。除非您之后将其复制到另一个数组。
  • @Wicket 不适用于包含多个数组的.npz 文件(至少在我的机器上)。当您实际尝试使用a['x'] 访问其中一个数组时,无论您是否指定mmap_mode=,整个内容都将作为标准np.array 而不是np.memmap 读入内存。

标签: python numpy file-io


【解决方案1】:

尺寸为(200, 1440, 3, 13, 32)np.complex128 数组在未压缩时应该占用大约 5.35GiB,所以如果您确实有 8.3GB 的空闲、可寻址内存,那么原则上您应该能够加载该数组。

但是,根据您在以下 cmets 中的回复,您使用的是 32 位版本的 Python 和 numpy。在 Windows 中,a 32 bit process can only address up to 2GB of memory(如果二进制文件是使用IMAGE_FILE_LARGE_ADDRESS_AWARE 标志编译的,则为 4GB;大多数 32 位 Python 发行版不是)。因此,无论您拥有多少物理内存,您的 Python 进程都被限制为 2GB 的地址空间。

您可以安装 64 位版本的 Python、numpy 和您需要的任何其他 Python 库,或者忍受 2GB 的限制并尝试解决它。在后一种情况下,您可能主要在磁盘上存储超过 2GB 限制的数组(例如,使用 np.memmap),但我建议您选择选项 #1,因为在内存映射数组上的操作要慢得多大多数情况下,与完全驻留在 RAM 中的普通 np.arrays 相比。


如果您已经有另一台机器有足够的 RAM 来将整个数组加载到核心内存中,那么我建议您以不同的格式保存数组(可以是普通的 np.memmap 二进制文件,或者更好的是,在 HDF5 中)使用PyTablesH5py 的文件)。也可以(虽然有点棘手)从.npz 文件中提取问题数组而不将其加载到 RAM 中,这样您就可以将其作为驻留在磁盘上的np.memmap 数组打开:

import numpy as np

# some random sparse (compressible) data
x = np.random.RandomState(0).binomial(1, 0.25, (1000, 1000))

# save it as a compressed .npz file
np.savez_compressed('x_compressed.npz', x=x)

# now load it as a numpy.lib.npyio.NpzFile object
obj = np.load('x_compressed.npz')

# contains a list of the stored arrays in the format '<name>.npy'
namelist = obj.zip.namelist()

# extract 'x.npy' into the current directory
obj.zip.extract(namelist[0])

# now we can open the array as a memmap
x_memmap = np.load(namelist[0], mmap_mode='r+')

# check that x and x_memmap are identical
assert np.all(x == x_memmap[:])

【讨论】:

  • 我怀疑一个数组可能需要一个连续范围的虚拟内存空间,至少对于其中的某些部分而言。
  • 我也可能是他正在使用限制为 4GB 地址空间的 x32 进程。
  • @atomh33ls 您能否确认您运行的是 32 位 Windows,还是仅限于 4GB 的地址空间?你能分配一个新的 4GB numpy 数组(例如foo = np.ones(536870912, np.float64))吗?
  • @atomh33ls 小崽子,有你的问题!安装 64 位版本的 Python、numpy 和您需要的任何其他 Python 库,或者使用 4GB 的可寻址内存限制。
  • 感谢@ali_m,我天真地认为操作系统只会允许使用所有可用的 RAM。另外,对于以后阅读的人,我发现thisthis 很有用
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2014-12-11
  • 2012-01-13
  • 1970-01-01
  • 2011-07-09
  • 2013-05-19
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多