【问题标题】:Calculte precision and recall for text mining result计算文本挖掘结果的准确率和召回率
【发布时间】:2016-07-02 06:14:17
【问题描述】:

我正在做一个项目来使用文本挖掘找出与疾病相关的基因。我为此使用了 1000 篇文章。我得到了大约 129 个基因名称。实际数据集包含大约 1000 个条目。现在我想计算我的方法的精度和召回率。当我进行比较时,在 129 个基因中,发现有 72 个是正确的。所以 精度 = 72/129。 这是正确的吗? 现在我该如何计算召回率?请帮忙

【问题讨论】:

    标签: machine-learning classification precision-recall


    【解决方案1】:

    Wikipedia Article on Precision and Recall 可能会有所帮助。 定义是:

    Precision: tp / (tp+fp)
    Recall: tp / (tp + fn)
    

    tp 是真阳性(与疾病相关的基因并且您发现它们),fp 是假阳性(您发现但它们实际上与疾病无关的基因)和 fn是假阴性(实际上与疾病相关的基因,但您没有找到它们)。

    我不太确定您发布的数字代表什么。你知道真正与疾病相关的基因吗?

    您很可能已经计算出准确度:

    Accuracy = (tp + fp) / (Total Number)
    

    【讨论】:

    • 感谢您的回复。我昨天把它弄清了,我把答案贴在下面。
    【解决方案2】:

    主要问题是我正在考虑的文章可能不包含所有最初列出的基因名称,因为它的数据集很小。因此,在计算召回率时,我可以将原始基因数据库与文章进行比较,以找出文献中存在多少原始相关基因,而不是将分母视为 1000。即,如果有 1000 个相关基因,我将检查 1000 个我正在考虑的数据集中有多少。如果是 300,我会将分母设置为 300 而不是 1000。这样可以召回。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2015-12-05
      • 2019-07-31
      • 2015-06-30
      • 1970-01-01
      • 2022-12-17
      • 2021-10-13
      • 2017-06-21
      • 2020-02-25
      相关资源
      最近更新 更多