【发布时间】:2017-09-19 14:06:24
【问题描述】:
我的情况是这样的。从大数据集(无法加载到内存中)中选择两张图像并将它们与神经网络进行比较。每个训练样本由随机从数据集中挑选的两张图像组成。这个随机过程是消除案例之间的协方差所必需的。
但我无法从记忆中挑选两个图像。因为计算机负担不起数据集的大小。因此,每次我制作样品时,我都需要访问慢速磁盘。这种磁盘访问时间会大大减慢学习过程。 到目前为止,我最好的想法是将数据集随机划分为多个内存负担得起的小数据集。然后,用每个小数据集一个一个地完全训练神经网络。
但是训练后的模型有可能被后来的小数据集打乱。
那么有什么好的方法来处理这种随机的大数据场景吗?
【问题讨论】:
标签: neural-network deep-learning bigdata