【问题标题】:POS Tagging too slow - using OpenNLPPOS 标记太慢 - 使用 OpenNLP
【发布时间】:2015-04-11 20:58:21
【问题描述】:

我只是在玩词性标记,并开始使用 OpenNLP。

我正在使用以下代码加载模型(Java):

        m_modelFile = new FileInputStream("c:\\DATA\\en-parser-chunking.bin");
        m_model = new ParserModel(m_modelFile);
        m_parser = ParserFactory.create(m_model);  
        ...
        Parse topParses[] = ParserTool.parseLine(sentence, m_parser, 1);

我注意到创建 ParserModel 对象的调用非常慢。可能是 b/c en-parser-chunking.bin 的大小为 35MB。有没有更好的方法来使用它,这样它就不会这么慢?或者,是否有您推荐的 POS 标记器或调用 API 更快的方法?

我一直在玩准确性,它非常好。但是,我对加载模型时的性能不满意......

谢谢大家。

【问题讨论】:

    标签: opennlp pos-tagger


    【解决方案1】:

    如果您正在寻找一个快速的 Java(或 Python)POS 标记器,您可以考虑使用RDRPOSTagger。 RDRPOSTagger 是一个强大、易于使用且与语言无关的 POS 和形态标记工具包。它在学习和标记过程中都获得了快速的性能。例如,在 Java 中,使用 Core2Duo 2.4 GHz 的计算机标记速度为 90K 英语单词/秒。与最先进的结果相比,它实现了极具竞争力的准确性。在this paper 中查看实验结果,包括 13 种语言的性能速度和标记准确性。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-03-10
      • 1970-01-01
      • 1970-01-01
      • 2016-10-30
      • 2016-07-02
      • 1970-01-01
      • 2017-03-08
      • 1970-01-01
      相关资源
      最近更新 更多