【发布时间】:2018-09-01 06:11:05
【问题描述】:
我在 ML Engine 上启动了一个 tensorflow 任务,大约 2 分钟后,我不断收到一条错误消息“replica master 0 exited with a non-zero status of 1.”
(顺便说一下,该任务在本地 ml-engine 下运行良好。)
问题:是否有任何地方或日志文件可以在其中查看有关所发生事件的更多信息?
日志查看器只提供以下内容:
{
insertId: "ibal72g1rxhr63"
logName: "projects/**-***-ml/logs/ml.googleapis.com%2Fcnn180322_170649"
receiveTimestamp: "2018-03-22T17:08:38.344282172Z"
resource: {
labels: {
job_id: "cnn180322_170649"
project_id: "**-***-ml"
task_name: "service"
}
type: "ml_job"
}
severity: "ERROR"
textPayload: "The replica master 0 exited with a non-zero status of 1."
timestamp: "2018-03-22T17:08:38.344282172Z"
}
提前感谢您的任何指点!
【问题讨论】:
-
你检查过机器学习/jobs下的console.cloud.google.com(然后点击job)查看内存使用情况吗?在错误之前或之后,Stackdriver 日志中是否还有其他信息(有时堆栈跟踪可能高几行)。
-
我确实看了看,没有发现任何进一步的帮助。前两个条目是“等待供应作业”。和“等待 TensorFlow 启动”。错误之后的一个只是“作业失败”。我想知道是否有办法捕获更多信息,让主节点写一些日志/调试信息?通过进一步的测试,我猜我的问题可能与我尝试安装一些 Python 依赖项的方式有关(通过 setup.py)。
标签: tensorflow google-cloud-ml