【问题标题】:Is there any way to inject "Resources" memory values for a pipeline in Data Fusion?有没有办法为数据融合中的管道注入“资源”内存值?
【发布时间】:2021-04-14 14:55:38
【问题描述】:

我正在尝试在 Google Cloud Data Fusion 中自动执行一些管道(我们目前使用的是 6.1.4 和 6.4.0)。此时,我们正在通过 PUT API 调用将一些“运行时参数”注入 DF。 我的问题是关于注入参数来修改配置部分。例如,我们目前正在使用“system.profile.name”参数来告诉此管道使用特定的配置文件,请参见: Screenshot of Runtime Arguments.

我想知道是否有任何类似的配置选项来定义“配置/资源/执行器内存”标签:Screenshot of "Configure/Resources" label。我知道这可以通过修改 UI 或在导入管道之前在管道模板 (json) 中设置不同的值来手动配置。但是我想知道在部署管道后是否有任何方法可以自动执行此操作(我不想每次修改时都重新部署管道)。

提前致谢!

【问题讨论】:

    标签: apache-spark google-cloud-data-fusion cdap


    【解决方案1】:

    我不相信可以将其设置为首选项,但您可以使用 CDAP 的 PUT API 在管道上传时进行设置,或更新管道:

    PUT /v3/namespaces/<namespace-id>/apps/<pipeline-name>

    {
        "name": "<pipeline-name>",
        "description": "Data Pipeline Application",
        "artifact": {
            "name": "cdap-data-pipeline",
            "version": "[6.1.1,7.0.0)",
            "scope": "SYSTEM"
        },
        "config": {
            "resources": {
                "memoryMB": 9999,
                "virtualCores": 9
            },
            "driverResources": {
                "memoryMB": 9999,
                "virtualCores": 9
            },
        ...
        }
    ...
    }
    

    上传的 JSON 应该是您的整个管道,但要根据您的偏好设置驱动程序和执行程序资源。这应该比每次都使用 UI 更容易实现自动化。如果您有更多问题,请告诉我。

    【讨论】:

    • 您好,我们希望避免通过 API 进行修改或重新上传管道。我们想注入这些独立性的论点。
    • 我了解,但该功能今天不存在。如果您认为应该在 github.com/cdapio/cdap 上提交 CDAP 存储库的功能请求。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2021-06-21
    • 1970-01-01
    • 1970-01-01
    • 2019-10-16
    • 2021-06-07
    • 2022-11-17
    • 1970-01-01
    相关资源
    最近更新 更多