【问题标题】:can NLTK/pyNLTK work "per language" (i.e. non-english), and how?NLTK/pyNLTK 可以“按语言”工作(即非英语),如何工作?
【发布时间】:2009-11-25 08:17:32
【问题描述】:

我如何告诉 NLTK 以特定语言处理文本?

有时我会编写一个专门的 NLP 例程来在非英语(但仍然是印欧语)文本域上进行 POS 标记、标记等。

这个问题似乎只针对不同的语料库,而不是代码/设置的变化: POS tagging in German

或者,是否有任何专门用于 python 的希伯来语/西班牙语/波兰语 NLP 模块?

【问题讨论】:

    标签: python nlp nltk


    【解决方案1】:

    我不确定您所说的代码/设置更改。 NLTK 主要依赖于机器学习,“设置”通常是从训练数据中提取的。

    当涉及到 POS 标记时,结果和标记将取决于您使用/训练的标记器。如果您自己训练,您当然需要一些西班牙语/波兰语训练数据。这些可能很难找到的原因是缺乏公开可用的金标准材料。有一些工具可以做到这一点,但这个工具不适用于 python (http://www.ims.uni-stuttgart.de/projekte/corplex/TreeTagger/)。

    nltk.tokenize.punkt.PunktSentenceTokenizer 分词器将根据多语言句子边界对句子进行分词,详细信息请参阅本文 (http://www.mitpressjournals.org/doi/abs/10.1162/coli.2006.32.4.485)。

    【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-10-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-02-22
    • 2011-05-15
    • 1970-01-01
    • 2014-12-22
    相关资源
    最近更新 更多