【发布时间】:2017-01-04 23:03:41
【问题描述】:
我有一个关于阅读器的 randomizationWindow 参数的快速问题。它在文档中说它控制内存中的数据量——但我有点不清楚它会对数据的随机性产生什么影响。如果训练数据文件以一种数据分布开始,以另一种完全不同的分布结束,设置小于数据大小的随机化窗口是否会导致提供给训练器的数据不是来自同质分布?我只是想仔细检查一下。
【问题讨论】:
标签: cntk
我有一个关于阅读器的 randomizationWindow 参数的快速问题。它在文档中说它控制内存中的数据量——但我有点不清楚它会对数据的随机性产生什么影响。如果训练数据文件以一种数据分布开始,以另一种完全不同的分布结束,设置小于数据大小的随机化窗口是否会导致提供给训练器的数据不是来自同质分布?我只是想仔细检查一下。
【问题讨论】:
标签: cntk
更详细地介绍随机化/IO:
所有语料库/数据总是分成块。块有助于提高 IO 效率,因为一个块的所有序列都是一次性读取的(通常一个块是 32/64MB)。
说到随机化,有两个步骤:
【讨论】:
AlexNet example config, line 114 中,我看到了randomizationWindow = 1 - 这是否意味着该示例在 IO 性能方面并不是最佳的?
当 randomizationWindow 设置为小于整个数据大小的窗口时,整个数据大小被分块为 randomizationWindow 大小的块,并且块的顺序是随机的。然后在每个块中,样本是随机的。
【讨论】: