【问题标题】:K-nearest-neighbour density estimation using the same data set, k=5使用相同数据集的 K-最近邻密度估计,k=5
【发布时间】:2013-09-04 18:35:11
【问题描述】:

这是关于非参数密度估计。

所以,我们有 2 个不同的数据 220 个“好数据”值和 30 个“坏数据”值 我们应该使用 k-最近邻密度估计来估计 p(x |c="good data")

如果 k=5,我们有 p(x |c=good) =(5/220)*(1/V)。

如果我理解正确,我们应该通过 k-nearest-neighbour 确定 V 然后得到 p(x |c=好) 如果我们必须找出 5 个点的 V,那么我们可以解决 p(x|c=good)

我有一个问题,如何绘制和计算这个概率。 书中有图片http://content.foto.mail.ru/mail/zurix/_mypagephoto/h-67.jpg K最近邻密度估计图形上的蓝色曲线是什么意思(你可以看到附件)​​?这条曲线可以显示不同 V 的边界吗?如果是,那么类之间的确切边界在哪里,每个类由 5 个点组成???

提前谢谢你!!

【问题讨论】:

标签: nearest-neighbor


【解决方案1】:

如果没有任何附加信息(例如图说明或书名),很难猜出这两条曲线的含义。

我最好的猜测是,绿色曲线是真实的(一维)密度,从中抽取数据点样本。蓝色曲线似乎是三个不同 k 值的结果密度估计函数。

这应该说明正确选择 k 的重要性,对于 k = 1,这会过度拟合数据(结果密度估计函数的高方差),对于 k = 30,这会“过度平滑”数据(结果的高偏差密度估计函数),因为它不会重现 0.3 左右的凹凸。

事实上,看看 k=1 的例子,在我看来这不是使用纯 1 / V 而是一些加权函数。对于每点的纯 1/V 估计,我希望有一个分段常数函数(只有几条水平线)。

【讨论】:

    猜你喜欢
    • 2015-01-19
    • 1970-01-01
    • 1970-01-01
    • 2014-04-12
    • 2019-05-26
    • 2012-07-19
    • 1970-01-01
    • 1970-01-01
    • 2018-04-08
    相关资源
    最近更新 更多