【发布时间】:2019-10-01 15:23:17
【问题描述】:
我正在运行一个梯度提升模型,需要大约 11 个小时来训练。我正在使用 Google Cloud 上的抢占式实例来执行此操作(因为它更便宜)。问题是,我一直在丢失我的进度,因为实例在模型能够完成训练之前就被终止了。
有没有办法检查点或将部分训练模型的进度保存到磁盘?这样当我重新运行代码时,训练应该从中断的地方继续。
我知道有 pickle 模块可以让我将对象转储到磁盘上。但我不是要保存一个完全训练的模型,而是一个部分训练的模型。
【问题讨论】:
标签: python scikit-learn