【发布时间】:2018-02-06 23:55:34
【问题描述】:
我知道外部 python 依赖项可以通过 requirements.txt 文件输入 Dataflow。我可以在我的 Dataflow 脚本中成功加载 nltk。但是,nltk 通常需要下载更多文件(例如停用词或 punkt)。通常在本地运行脚本时,我可以运行
nltk.download('stopwords')
nltk.download('punkt')
这些文件将可用于脚本。我该怎么做才能使这些文件也可用于工作脚本。如果每个工作人员只需要执行一次这些命令,那么将这些命令放入 doFn/CombineFn 似乎效率极低。脚本的哪一部分保证在每个工作人员上运行一次?那可能是放置下载命令的地方。
根据this,Java 允许通过类路径暂存资源。这不是我在 Python 中寻找的东西。我也不是在寻找一种方法来加载额外的 python 资源。我只需要 nltk 来查找它的文件。
【问题讨论】:
-
你是怎么解决这个问题的?我也面临同样的问题
-
我按照下面 Raghu Angadi 的回答中的说明进行操作。
标签: google-cloud-platform google-cloud-dataflow apache-beam google-data-api