【问题标题】:how to deal nerual network trainning with big data which needs to be randomly accessed如何处理需要随机访问的大数据的神经网络训练
【发布时间】:2017-09-19 14:06:24
【问题描述】:

我的情况是这样的。从大数据集(无法加载到内存中)中选择两张图像并将它们与神经网络进行比较。每个训练样本由随机从数据集中挑选的两张图像组成。这个随机过程是消除案例之间的协方差所必需的。

但我无法从记忆中挑选两个图像。因为计算机负担不起数据集的大小。因此,每次我制作样品时,我都需要访问慢速磁盘。这种磁盘访问时间会大大减慢学习过程。 到目前为止,我最好的想法是将数据集随机划分为多个内存负担得起的小数据集。然后,用每个小数据集一个一个地完全训练神经网络。

但是训练后的模型有可能被后来的小数据集打乱。

那么有什么好的方法来处理这种随机的大数据场景吗?

【问题讨论】:

    标签: neural-network deep-learning bigdata


    【解决方案1】:

    如何压缩图像以进行训练?

    训练网络后,分类通常很快。您可以尝试压缩一组图像并将它们缓冲在内存中,例如,使用队列每 n 毫秒从线程接收一个新的随机选择的图像。另一个线程从队列中选择图像并对其进行处理以进行训练。生产者/消费者模式可能是此类任务的不错选择。 训练后,您可以对分类任务进行在线压缩。这会稍微降低性能,但由于分类通常很快,所以就足够了。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-04-07
      • 1970-01-01
      • 2012-12-04
      • 2016-04-02
      • 2018-01-23
      • 2010-11-20
      • 2019-09-15
      • 1970-01-01
      相关资源
      最近更新 更多