【发布时间】:2017-05-29 16:09:47
【问题描述】:
我是 Python 新手,来自 Java 背景。
我有一个项目,它使用nltk 和nltk_data。我在笔记本电脑上下载了nltk_data 和nltk.download(),项目运行良好,但我想自动下载nltk_data。
我可以从命令行下载它,但我想懒洋洋地做,因为pip 在pip install 上下载包。所以我的问题是:
- 我可以将
nltk_data安装为带有pip的常规Python 包吗? - 懒惰下载
nltk_data的最佳方式是什么?
【问题讨论】:
-
使用 pip 是不可能的,因为
nltk_data不是 python 库,而只是一个文件存储库。使用python -m nltk.downloader all。 -
谢谢。结果我只需要所有
nltk_data的一个子集。将这个子集“打包”为我的项目依赖项以分发我的程序的最佳方式是什么? -
你需要哪个数据集?
-
corpora/stopwords、stemmers和tokenizers。 -
我不想将这些数据存储在 git 中,因为它是外部依赖项,而不是我的项目代码。另一方面,我不想每次构建项目时都下载
nltk_data。这就是为什么我想知道如何将nltk_data打包为 python 包。