【发布时间】:2018-04-27 17:31:49
【问题描述】:
我在使用 Apache Beam Python SDK 定义的数据流时遇到了一些问题。如果我单步执行我的代码,它会到达 pipeline.run() 步骤,我认为这意味着执行图已成功定义。但是,该作业从未在 Dataflow 监控工具上注册,this 让我认为它永远不会到达管道验证步骤。
我想详细了解这两个步骤之间发生的情况,以帮助调试问题。我看到输出表明我的 requirements.txt 和 apache-beam 中的包正在安装 pip,并且在发送到 Google 的服务器之前似乎有些东西被腌制了。这是为什么?如果我已经下载了 apache-beam,为什么还要重新下载呢?究竟是什么被腌制了?
我不是在这里寻找解决我的问题的方法,只是想更好地理解这个过程。
【问题讨论】:
-
对于 Apache Beam 的 pip 安装,您的机器上是否安装了最新版本?安装有没有报错?
-
我将最新版本安装到虚拟环境中。出于某种原因,第二个 apache-beam 下载会抱怨找不到
nose并退出。将nose安装到虚拟环境中修复了该问题。但是,将其放入requirements.txt不会。不知道为什么它首先需要一个测试包。
标签: python google-cloud-dataflow apache-beam