【问题标题】:ERROR: Couldn't match files for checkpoint gs://obj-detection/train/model.ckpt错误:无法匹配检查点 gs://obj-detection/train/model.ckpt 的文件
【发布时间】:2018-07-14 16:37:46
【问题描述】:

我在 google cloud ml 上运行我的检测模型,并在运行评估脚本时遇到此错误。我发现this link 提到了这个问题,但似乎这个问题还没有解决。任何人都知道如何解决这个问题?任何帮助将不胜感激。谢谢。

错误 2018-02-04 12:53:10 -0600 master-replica-0 无法匹配文件 对于检查点 gs://obj-detection/train/model.ckpt-0

INFO 2018-02-04 12:53:10 -0600 master-replica-0 找不到模型 gs://obj-检测/训练。将在 300 秒后重试

INFO 2018-02-04 12:58:10 -0600 master-replica-0 开始评估 在 2018-02-04-18:58:10

错误 2018-02-04 12:58:10 -0600 master-replica-0 无法匹配文件 对于检查点 gs://obj-detection/train/model.ckpt-0

INFO 2018-02-04 12:58:10 -0600 master-replica-0 找不到模型 gs://obj-检测/训练。将在 300 秒后重试

...

当训练日志工作如下:

...大约运行 14 小时

INFO 2018-02-04 05:09:05 -0600 worker-replica-3 全局步骤 185874: 损失 = 0.7012(0.764 秒/步)

INFO 2018-02-04 05:09:05 -0600 worker-replica-4 全局步骤 185873: 损失 = 0.7749(0.797 秒/步)

INFO 2018-02-04 05:09:05 -0600 worker-replica-2 全局步骤 185875: 损失 = 0.4939(0.775 秒/步)

INFO 2018-02-04 05:09:05 -0600 master-replica-0 全局步骤 185877: 损失 = 1.1430(0.850 秒/步)

INFO 2018-02-04 05:09:05 -0600 worker-replica-1 全局步骤 185878: 损失 = 0.8231(0.777 秒/步)

INFO 2018-02-04 05:09:05 -0600 worker-replica-0 全局步骤 185881: 损失 = 0.6470(0.779 秒/步)

【问题讨论】:

  • 您是否尝试过您链接到的另一个案例的第一条评论中的建议? “您的 GCS 存储桶是区域存储桶还是多区域存储桶?您想使用区域存储桶(请参见此处),因为 GCS 对区域存储桶的一致性保证比多区域存储桶更强大。Cloud ML 的入门指南包含有关创建区域桶。”
  • 感谢您的评论。是的,我确实在配置中使用 us-central1 创建了一个区域存储桶。

标签: tensorflow object-detection tensorboard google-cloud-ml


【解决方案1】:

需要检查的几件事:

  1. 训练代码是否设置为实际导出检查点?如果您使用的是 Estimator,这通常是可行的,前提是您使用的是运行 Estimator 的标准方法(例如,在 TF >=1.4 中,Estimator.train_and_evaluate)。
  2. 您是否将正确的输出目录传递给保存检查点的代码?例如,训练代码是否可以将检查点输出到本地(临时?)目录而不是 GCS?可以将检查点保存到 GCS 上的不同目录吗?快速扫描代码 + 一些放置良好的打印/日志语句在这里很有用。
  3. 训练代码导出检查点的频率如何?例如,如果只节省 10 分钟,那么每次成功的评估都会收到大约 1-2 条“未找到模型”消息。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-08-08
    • 2013-11-03
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多