【发布时间】:2021-09-02 16:23:28
【问题描述】:
我正在使用 TFX 在 Vertex AI 上构建 AI 管道。我已经关注this tutorial 开始,然后我将管道调整为我自己的数据,其中包含超过 1 亿行时间序列数据。由于内存问题,我的一些组件在中途被杀死,所以我只想为这些组件设置内存要求。我使用KubeflowV2DagRunner 使用以下代码在 Vertex AI 中编排和启动管道:
runner = tfx.orchestration.experimental.KubeflowV2DagRunner(
config=tfx.orchestration.experimental.KubeflowV2DagRunnerConfig(
default_image = 'gcr.io/watch-hop/hop-tfx-covid:0.6.2'
),
output_filename=PIPELINE_DEFINITION_FILE)
_ = runner.run(
create_pipeline(
pipeline_name=PIPELINE_NAME,
pipeline_root=PIPELINE_ROOT,
data_path=DATA_ROOT, metadata_path=METADATA_PATH))
similar question 已在 Stack Overflow 上得到答复,这使我找到了 set memory requirements in AI Platform 的方法,但这些配置在 KubeflowV2DagRunnerConfig 中不再存在,所以我陷入了死胡同。
任何帮助将不胜感激。
** 编辑 **
我们使用 @component 装饰器将我们的组件定义为 python 函数,因此它们中的大多数都是自定义组件。对于训练组件,我知道您可以使用 tfx.Trainer 类指定机器类型,如 this tutorial 中所述,但我的问题是针对未进行任何训练的自定义组件。
【问题讨论】:
标签: tfx google-cloud-ai-platform-pipelines