【发布时间】:2018-06-30 03:56:29
【问题描述】:
我是分布式 TensorFlow 的新手。现在我只是想让一些现有的例子工作,这样我就可以学习如何正确地做。
我正在按照此处的说明在一台具有一名工作人员和一名 PS 的 Linux 机器上训练初始网络。 https://github.com/tensorflow/models/tree/master/research/inception#how-to-train-from-scratch-in-a-distributed-setting
程序在 CreateSession 期间挂起并显示以下消息: CreateSession 仍在等待工作人员的响应:/job:ps/replica:0/task:0
这是我启动工人的命令:
./bazel-bin/inception/imagenet_distributed_train \
--batch_size=32 \
--data_dir=/datasets/BigLearning/jinlianw/imagenet_tfrecords/ \
--job_name='worker' \
--task_id=0 \
--ps_hosts='localhost:2222' \
--worker_hosts='localhost:2223'
这是我启动 PS 的命令:
./bazel-bin/inception/imagenet_distributed_train \
--job_name='ps' \
--task_id=0 \
--ps_hosts='localhost:2222' \
--worker_hosts='localhost:2223'
打印后PS进程挂起:
2018-06-29 21:40:43.097361: 我 tensorflow/core/distributed_runtime/rpc/grpc_server_lib.cc:332] 使用目标启动服务器:grpc://localhost:2222
初始模型仍然是分布式 TensorFlow 的有效示例还是我做错了什么?
谢谢!
【问题讨论】:
-
很遗憾,这可能是由多种原因造成的。请参阅我在 TF 上的问题:github.com/tensorflow/tensorflow/issues/41101 我提到了几个设置环境变量以从 grpc 获取更多日志。很高兴您找到了解决方案。你是怎么想出来的?