【发布时间】:2017-11-27 16:56:45
【问题描述】:
我正在运行 Tensorflow 对象检测 API 来使用 object_detection/train.py 脚本(找到 here)训练我自己的检测器。问题是我不断收到CUDA_ERROR_OUT_OF_MEMORY。
我找到了一些减少批量大小的建议,以便训练器消耗更少的内存,但我从 16 减少到 4,但我仍然遇到同样的错误。不同的是,当使用batch_size=16时,错误在~18步抛出,现在在~70步抛出。 编辑: 设置 batch_size=1 并没有解决问题,因为我在 ~2700 步仍然遇到错误。
在我停止训练过程之前,我该怎么做才能让它顺利运行?我真的不需要快速训练。
编辑: 我目前正在为此使用 GTX 750 Ti 2GB。除了训练和提供监视器图像之外,GPU 没有用于其他任何用途。目前,我只使用 80 张图像进行训练,20 张图像进行评估。
【问题讨论】:
-
添加更多关于您的 GPU 大小、训练数据大小以及您是否在其他任何地方同时使用 GPU 的信息?
-
@SmitShilu 添加了请求的信息。感谢您帮助我!
-
很抱歉,我无法复制,但如果每张图片都是高分辨率的,则可能是图片尺寸问题或参考此链接github.com/tensorflow/models/issues/1854
标签: python tensorflow object-detection tensorflow-gpu