【问题标题】:Dataflow process hanging数据流进程挂起
【发布时间】:2018-02-06 22:18:32
【问题描述】:

我正在数据流上运行批处理作业,从 BigQuery 进行查询。当我使用 DirectRunner 时,一切正常,结果被写入一个新的 BigQuery 表。当我更改为 DataflowRunner 时,事情似乎中断了。

日志显示成功启动了 30 个工作器实例。 Web UI 中的图表显示作业已开始。前 3 步显示“正在运行”,其余显示“未开始”。没有一个步骤显示任何转换的记录(即输出集合都显示'-')。日志显示许多类似这样的消息,这可能是问题所在:

skipping: failed to "StartContainer" for "python" with CrashLoopBackOff: "Back-off 10s restarting failed container=python pod=......

我后退了一步,只运行了最小字数示例,并且成功完成了。因此,似乎为 Dataflow 运行器启用了所有必要的 API。我只是想了解导致我的 Dataflow 作业挂起的原因。

我正在执行这样的工作:

python2.7 script.py --runner DataflowRunner --project projectname --requirements_file requirements.txt --staging_location gs://my-store/staging --temp_location gs://my-store/temp

【问题讨论】:

    标签: google-cloud-platform google-cloud-dataflow google-data-api


    【解决方案1】:

    我不确定我的解决方案是否是上面粘贴的错误的原因,但修复依赖关系问题(根本没有在日志中显示为错误!)确实解决了挂起的数据流过程。

    因此,如果您有一个挂起的流程,请确保您的工作人员具有所有必要的依赖项。您可以通过 --requirements_file 参数或自定义 setup.py 脚本提供它们。

    感谢this post 提供的帮助,管道似乎正在运行,尽管VERY SLOWLY

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-04-10
      • 1970-01-01
      • 1970-01-01
      • 2017-01-06
      • 2017-02-28
      相关资源
      最近更新 更多