【问题标题】:nltk dependencies in dataflow数据流中的 nltk 依赖项
【发布时间】:2018-02-06 23:55:34
【问题描述】:

我知道外部 python 依赖项可以通过 requirements.txt 文件输入 Dataflow。我可以在我的 Dataflow 脚本中成功加载 nltk。但是,nltk 通常需要下载更多文件(例如停用词或 punkt)。通常在本地运行脚本时,我可以运行

nltk.download('stopwords')
nltk.download('punkt')

这些文件将可用于脚本。我该怎么做才能使这些文件也可用于工作脚本。如果每个工作人员只需要执行一次这些命令,那么将这些命令放入 doFn/CombineFn 似乎效率极低。脚本的哪一部分保证在每个工作人员上运行一次?那可能是放置下载命令的地方。

根据this,Java 允许通过类路径暂存资源。这不是我在 Python 中寻找的东西。我也不是在寻找一种方法来加载额外的 python 资源。我只需要 nltk 来查找它的文件。

【问题讨论】:

  • 你是怎么解决这个问题的?我也面临同样的问题
  • 我按照下面 Raghu Angadi 的回答中的说明进行操作。

标签: google-cloud-platform google-cloud-dataflow apache-beam google-data-api


【解决方案1】:

您或许可以使用“--setup_file setup.py”来运行这些自定义命令。 https://cloud.google.com/dataflow/pipelines/dependencies-python#pypi-dependencies-with-non-python-dependencies 。这对你有用吗?

【讨论】:

    猜你喜欢
    • 2015-01-04
    • 2019-11-21
    • 2018-07-31
    • 1970-01-01
    • 1970-01-01
    • 2021-06-02
    • 1970-01-01
    • 1970-01-01
    • 2018-02-20
    相关资源
    最近更新 更多