【发布时间】:2018-11-30 14:07:11
【问题描述】:
是否有支持 nltk 的 Python 前端?
我正在构建一个自定义应用程序,该应用程序需要对来自浏览器内部的简单单词查询进行词干提取和停止以及相关处理。我熟悉 nltk 的 stem/stop 功能,但是快速搜索 Python 前端替代品 listed in this thread 并没有提供对 nltk 的支持。我试过pypy.js from its website,输入“import nltk”,失败了。
(如果需要,我计划使用 CherryPy 作为后端,以便在第一次联系时将应用程序提供给浏览器,并处理输出。)
是否有与 nltk 一起使用的前端?或者:
- 我可以将 nltk 支持添加到这些环境中吗?如何添加?
- 是否有其他库可以与这些前端一起使用进行词干/停止?
谢谢!
【问题讨论】:
-
出于好奇,它是多语言还是特定语言。如果它仅适用于一种语言并且它是没有屈折变化的分析,即使是粘着的(例如高棉语),考虑到它适用于浏览器,您可能会找到一种不需要完整 nltk 的更轻松的方法,例如基于 dict 的最长单词方法(从最大匹配开始)。也适用于中文。为了提高速度,可以使用二元组来仅查看字典的子集。
-
我真的只需要“干”单词(running,runs,ran --> run),并修剪“stop”单词(the, a, an, if, was, ... ),我也不需要那么挑剔;我正在构建一个研究原型。我可能只是摄取一些代码,但我也知道有 Javascript 库可以做到这一点。感谢您的评论!
标签: python nltk transcrypt skulpt