【问题标题】:Is there a theory to test the maximum theoretical accuracy for a data set?是否有理论可以测试数据集的最大理论准确性?
【发布时间】:2020-05-29 11:59:29
【问题描述】:

我正在将几种机器学习方法应用于真实世界的医疗数据集,但我无法为测试数据集实现高精度(现在约为 80%)。预测疾病是否存在的问题。

有什么方法可以证明最大精度可以达到多少?或者类似的东西可以判断特定机器学习模型对数据集的预期准确性?

如果不是,我如何证明我得到的准确度是数据集中可能的最佳(或接近最佳)准确度?

【问题讨论】:

  • 我不认为这样的事情存在。你有这个问题的基准吗?
  • 没有可用的基准。我只需要从理论上证明我得到的准确度是数据集中可能的最佳(接近最佳)准确度。 @FilipeLauar
  • 这不是对实际问题的回答,但为了获得一些见解,创建一些学习曲线可能会很有趣:stackoverflow.com/questions/4617365/…
  • 所以我认为这是不可能的。最好的结果始终是 100% 的准确度。您的问题的最佳准确性取决于您的数据和您使用的模型。如果 80% 对您的应用来说还不够好,您应该考虑进行特征工程并测试其他模型和算法。

标签: machine-learning classification data-science prediction


【解决方案1】:

人工检测的准确率是多少?

如果它几乎是您通过机器获得的准确度,那么您做得很好!即使机器做得差一点,它甚至可以被认为是好的。

在业界,这样的问题多是产品管理问题,而不是科学问题。

【讨论】:

  • 你的意思是计算先验概率吗?由医院/医生确定的百分比?
  • 对。这通常会给你一个经验法则。如果您比医生好得多,那么也许您不会太在意进一步提高准确性。如果你得到的更少,它可能仍然可以接受,具体取决于产品,或者你可能有改进的空间。
【解决方案2】:

这取决于您的数据的确定性。我将用两个变量来说明,y 作为 x 的函数。

如果 y = x,那么理论上的最佳准确度是 100%。应该可以得到完美的结果。

现在假设 y = x + rnorm(n, 0, sigma) 其中 n 是点数,您可以选择 sigma。您可以预测 x,但无法预测随机部分。 sigma 越大,您的预测就越差。您可以通过选择足够大的 sigma 来使尽可能低的最佳精度。

对于真实数据,您通常不知道输入变量对输出的影响程度,因此您无法仅说明准确度在 0 和 1 之间的有意义的理论极限。

【讨论】:

    猜你喜欢
    • 2011-11-18
    • 1970-01-01
    • 2010-10-17
    • 1970-01-01
    • 2020-03-26
    • 1970-01-01
    • 2011-03-16
    • 1970-01-01
    • 2015-05-29
    相关资源
    最近更新 更多