【问题标题】:Distributed TensorFlow hangs during CreateSession分布式 TensorFlow 在 CreateSession 期间挂起
【发布时间】:2018-06-30 03:56:29
【问题描述】:

我是分布式 TensorFlow 的新手。现在我只是想让一些现有的例子工作,这样我就可以学习如何正确地做。

我正在按照此处的说明在一台具有一名工作人员和一名 PS 的 Linux 机器上训练初始网络。 https://github.com/tensorflow/models/tree/master/research/inception#how-to-train-from-scratch-in-a-distributed-setting

程序在 CreateSession 期间挂起并显示以下消息: CreateSession 仍在等待工作人员的响应:/job:ps/replica:0/task:0

这是我启动工人的命令:

./bazel-bin/inception/imagenet_distributed_train \
    --batch_size=32 \
    --data_dir=/datasets/BigLearning/jinlianw/imagenet_tfrecords/ \
    --job_name='worker' \
    --task_id=0 \
    --ps_hosts='localhost:2222' \
    --worker_hosts='localhost:2223'

这是我启动 PS 的命令:

./bazel-bin/inception/imagenet_distributed_train \
    --job_name='ps' \
    --task_id=0 \
    --ps_hosts='localhost:2222' \
    --worker_hosts='localhost:2223'

打印后PS进程挂起:

2018-06-29 21:40:43.097361: 我 tensorflow/core/distributed_runtime/rpc/grpc_server_lib.cc:332] 使用目标启动服务器:grpc://localhost:2222

初始模型仍然是分布式 TensorFlow 的有效示例还是我做错了什么?

谢谢!

【问题讨论】:

  • 很遗憾,这可能是由多种原因造成的。请参阅我在 TF 上的问题:github.com/tensorflow/tensorflow/issues/41101 我提到了几个设置环境变量以从 grpc 获取更多日志。很高兴您找到了解决方案。你是怎么想出来的?

标签: tensorflow distributed


【解决方案1】:

问题已解决。原来这是由于GRPC。我的集群机器有一个环境变量 http_proxy 集。取消设置这个变量可以解决问题。

【讨论】:

    猜你喜欢
    • 2021-06-28
    • 1970-01-01
    • 1970-01-01
    • 2011-10-26
    • 1970-01-01
    • 1970-01-01
    • 2021-01-17
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多