【发布时间】:2021-05-29 10:50:56
【问题描述】:
我正在使用 pytorch,但在读取大型数据集时遇到了麻烦。考虑到数据的大小,有必要将它们保存为文件。
我没有将数据预处理成批处理并将它们分别保存为文件,而是寻找一种可以仅读取一个或几个二进制文件的特定部分的方法,并带有指示相应文件的索引文件(如果需要)和寻找职位。
例如,假设一个数据集文件包含很多图像(可能大小不同),以及一个指示每个图像的开始位置和结束位置的索引文件。使用索引文件初始化类似字典或类似列表的容器data。当我想读取第三张图片时,我可以简单地使用data[2],它可以快速跳转到特定位置并返回我想要的内容。
是否有现有的方法可以很好地处理它?据我所知,SQL 或 pandas 可能是固定字段长度数据的可能解决方案,但我不知道它们是否可以处理各种字段长度和二进制数据。
【问题讨论】:
-
看看HDF5格式?
-
@Corralien 谢谢! H5PY 模块真的很管用!
标签: python pandas database numpy pytorch