【问题标题】:How to create the config.yaml file for distributed training on Unified Cloud AI Platform如何在统一云 AI 平台上创建用于分布式训练的 config.yaml 文件
【发布时间】:2021-06-19 04:59:29
【问题描述】:

我希望使用 Google Cloud 的新服务 - 统一 AI 平台来训练模型。为此,我使用了如下所示的config.yaml

workerPoolSpecs:
  workerPoolSpec:
    machineSpec:
      machineType: n1-highmem-16
      acceleratorType: NVIDIA_TESLA_P100
      acceleratorCount: 2
    replicaCount: 1
    pythonPackageSpec:
      executorImageUri: us-docker.pkg.dev/cloud-aiplatform/training/tf-gpu.2-4:latest
      packageUris: gs://path/to/bucket/unified_ai_platform/src_dist/trainer-0.1.tar.gz
      pythonModule: trainer.task
  workerPoolSpec:
    machineSpec:
      machineType: n1-highmem-16
      acceleratorType: NVIDIA_TESLA_P100
      acceleratorCount: 2
    replicaCount: 2
    pythonPackageSpec:
      executorImageUri: us-docker.pkg.dev/cloud-aiplatform/training/tf-gpu.2-4:latest
      packageUris: gs://path/to/bucket/unified_ai_platform/src_dist/trainer-0.1.tar.gz
      pythonModule: trainer.task

但是对于分布式训练,我无法理解如何在此文件中传递多个 workerPoolSpecs。提供的示例yaml file 没有考虑我可以提供多个workerPoolSpecs 的情况。

该示例的文档还说“您可以指定多个工作程序池规范以创建具有多个工作程序池的自定义作业”。

我们将不胜感激。

【问题讨论】:

  • 根据doc,您选择的 GPU 必须在您执行自定义训练的位置可用。
  • @Mahboob GPU 没问题。我想知道如何在配置文件中指定多个工作池规范。
  • @JashShah 你收到错误消息了吗?如果是,请确保将其添加到问题中。

标签: google-cloud-platform gcp-ai-platform-training google-ai-platform google-cloud-ai google-cloud-ai-platform-pipelines


【解决方案1】:

回答我自己的问题。 config.yaml 文件应如下所示:

workerPoolSpecs:
  - machineSpec:
      machineType: n1-standard-16
      acceleratorType: NVIDIA_TESLA_P100
      acceleratorCount: 2
    replicaCount: 1
    containerSpec:
      imageUri: gcr.io/path/to/container:v2
      args: 
        - --model-dir=gs://path/to/model
        - --tfrecord-dir=gs://path/to/training/data/
        - --epochs=2
  - machineSpec:
      machineType: n1-standard-16
      acceleratorType: NVIDIA_TESLA_P100
      acceleratorCount: 2
    replicaCount: 2
    containerSpec:
      imageUri: gcr.io/path/to/container:v2
      args: 
        - --model-dir=gs://path/to/models
        - --tfrecord-dir=gs://path/to/training/data/
        - --epochs=2

【讨论】:

    猜你喜欢
    • 2020-02-17
    • 2020-02-27
    • 2019-10-22
    • 2020-08-31
    • 1970-01-01
    • 2021-06-12
    • 2020-11-21
    • 1970-01-01
    • 2019-11-27
    相关资源
    最近更新 更多