【发布时间】:2019-05-30 17:51:25
【问题描述】:
我正在使用 AWS Sagemaker 进行模型训练和部署,这是模型训练的示例
from sagemaker.estimator import Estimator
hyperparameters = {'train-steps': 10}
instance_type = 'ml.m4.xlarge'
estimator = Estimator(role=role,
train_instance_count=1,
train_instance_type=instance_type,
image_name=ecr_image,
hyperparameters=hyperparameters)
estimator.fit(data_location)
这里提到的docker镜像是一个tensorflow系统。
假设训练模型需要 1000 秒,现在我将实例数增加到 5,那么训练时间将增加 5 倍,即 5000 秒。据我了解,培训工作将分配给 5 台机器,因此理想情况下每台机器需要 200 秒,但似乎它在每台机器上进行单独的训练。有人可以让我知道它在一般分布式系统或 Tensorflow 上的工作。
我试图在这个文档https://docs.aws.amazon.com/sagemaker/latest/dg/sagemaker-dg.pdf 上找到答案,但似乎这里没有提到在分布式机器上工作的方式。
【问题讨论】:
标签: python tensorflow amazon-sagemaker