【问题标题】:Using the Tokenizer in openNLP在 openNLP 中使用 Tokenizer
【发布时间】:2015-01-13 11:12:36
【问题描述】:

我在 R 中以以下形式获取 POS 标记文本:


id   类型   开始   结束     功能
1    单词     1         5        POS=NNP
2    字    7         8        POS=IN

.....

例如,我想检索它已标记的单词,而不是具有所有值的列“type”,因为单词检索实际单词。我可以使用scan_tokenizer,但是当有像“不是”这样的形式时,问题就出现了,POS标记器将它分成“是”和“不是”,这很好,但是scan_tokenizer不会以这种方式标记它只是保持它在“不是”。谁能帮我检索 R 已标记并用于 POS 标记的单词?

谢谢

【问题讨论】:

    标签: nlp opennlp


    【解决方案1】:

    为什么不使用伊利诺伊 POS 标记器?它易于使用和可视化:

    http://cogcomp.cs.illinois.edu/page/software_view/3

    http://cogcomp.cs.illinois.edu/demo/pos/?id=4

    【讨论】:

    • 嗨,丹尼尔,谢谢。我想到的几个问题是:(1)它是否具有与最大熵模型相同的准确度水平? (2) 它可以在有多个文件的文件夹上工作吗?我还使用了能够用于第二部分的树标记器,但我有点担心某些准确性。虽然我喜欢斯坦福模型,但我不知道如何让它在多个文件上运行并获得结构化输出。
    • (1) 在介绍它的论文中,它是最先进的模型之一。 (2) 绝对有可能。如果您以编程方式使用它们,您可以一个一个地读取和解析每个文件。
    猜你喜欢
    • 2016-10-16
    • 1970-01-01
    • 2018-12-19
    • 1970-01-01
    • 2019-02-12
    • 2011-08-15
    • 1970-01-01
    • 2018-06-04
    • 1970-01-01
    相关资源
    最近更新 更多