【发布时间】:2018-07-31 11:44:46
【问题描述】:
我已经四处寻找与此相关的问题,但没有任何结果,所以我们开始吧:
我正在开发一个玩具 python 包以部署在 PyPi.org 上。它的一部分工作涉及简化解析文本和生成标记化句子的过程。自然地,我考虑过使用 nltk 来完成这项工作,并亲自使用了软件包中的 punkt 等工具。
这是问题和我的问题:查看了 nltk 的大小和它的工作要求,语料库大小接近 10 GB,我得出了结论考虑到它的用例,这对任何想要使用我的包的人来说都是一个奇怪的负担。
无论如何要部署punkt 的“预训练”实例?或者我可以控制nltk使用的语料库的大小吗?
对于解析相对“健全”的人类文本的替代软件包/解决方案,我同样持开放态度,它的性能有点接近 nltk,但没有相同的磁盘内存占用。
感谢您的帮助。
@matisetorm 为我指出的解决方案如下:
python -m nltk.downloader punkt
【问题讨论】: