【问题标题】:Named Entity Recognition confidence命名实体识别置信度
【发布时间】:2018-08-27 08:33:37
【问题描述】:

我需要对每个提取的实体进行置信(不是打印它,而是获取它),但是,我找不到返回置信度的方法。

首先,我尝试在 Java 上使用斯坦福命名实体识别器库和这个解决方案:

Display Stanford NER confidence score

但它不起作用(我猜 getCliqueTree 方法不可用)。我也尝试过在 Python 和斯坦福 NER 模型中使用 NLTK 来提取实体,但还是找不到获得置信度的方法。

我知道如何在 Spacy 上做到这一点:

https://github.com/explosion/spaCy/issues/831

但正如作者所说,它效率低下。

那么,你能告诉我,如何获得每个提取实体的概率吗?

【问题讨论】:

    标签: nltk stanford-nlp named-entity-recognition


    【解决方案1】:

    通常NER是一个token级别的分类任务。

    置信度通常来自每个预测,通常是某种类型的 softmax 的输出。

    那么问题就变成了,我如何才能获得一系列置信度的置信度?

    有多种方式:

    1. 熵 [置信度是信息量]
    2. 平均值(平均值)[置信度是平均值]
    3. 置信度的最小值/最大值 [置信度是最小值/最大值]

    所有这些都给出了不同的答案,没有一个是“更好”的,这实际上取决于您的用例。

    如果您想订购可能的实体类型,可以从以下开始:

    1. 假设每个标记的标签相同,获取置信度
    2. 获取置信度(概率)序列的熵
    3. 按熵排序

    【讨论】:

    • 这不能回答问题。
    猜你喜欢
    • 2021-06-03
    • 2018-03-26
    • 1970-01-01
    • 2014-03-17
    • 2011-07-31
    • 2018-03-08
    • 2020-07-02
    • 1970-01-01
    • 2010-11-04
    相关资源
    最近更新 更多