【问题标题】:Intuition behind Kernelized perceptron内核化感知器背后的直觉
【发布时间】:2015-11-13 01:07:38
【问题描述】:

我了解内核化感知器函数的推导,但我试图弄清楚最终公式背后的直觉

f(X) = sum_i (alpha_i*y_i*K(X,x_i))

(x_i,y_i) 是训练数据中的所有样本,alpha_i 是我们在该样本上犯错的次数,X 是我们试图预测的样本(在训练期间或其他)。现在,我明白了为什么核函数被认为是相似度的度量(因为它是高维空间中的点积),但我不明白这个公式是如何组合在一起的。

我最初的尝试是,我们试图根据它与其他样本的相似程度来预测一个样本 - 并将其乘以 y_i 以便它贡献正确的符号(更接近的点是更好的指标标签比更远的点)。但是为什么我们犯了几个错误的样本应该贡献更多呢?

tl;dr:在核化感知器中,为什么我们犯了几个错误的样本比我们没有犯错的样本对预测的贡献更大?

【问题讨论】:

    标签: machine-learning perceptron


    【解决方案1】:

    我最初的尝试是,我们试图根据样本与其他样本的相似程度来预测样本 - 并将其乘以 y_i 以便它贡献正确的符号(更接近的点是标签的更好指示符比更远的点)。

    这几乎就是正在发生的事情。虽然这个想法是如果alpha_i*y_i*K(X,x_i) 已经被很好地分类,那么您不需要进一步更新它。

    但如果该点被错误分类,我们需要对其进行更新。最好的方法是相反的方向,对吧?如果结果是负数,我们应该添加一个正数(y_i)。如果结果是正的(并且它被错误分类),那么我们想要对一个负值求和(再次是 y_i)。

    如您所见,y_i 已经为我们提供了正确的更新方向,因此我们使用错误分类计数器来确定更新的幅度。

    【讨论】:

    • 我的困惑主要在于alpha_i 方面。您不是在查看当前样本 X 中犯的错误数量,而是查看其他样本中的错误数量。考虑到这里没有明确的“更新”,我想知道为什么一个被错误分类的点对最终预测的贡献更大(因为该总和给出的符号是类)比正确分类的点。跨度>
    • I'm wondering why a point that was misclassified multiple times contributes more to the final prediction 因为它干扰更多,那些已经在现场的你不想过多地接触它们。这是一个疯狂的类比,一位老师和她的X_i 孩子,其中alpha_i 是每个孩子花费的时间。老师更有可能花更多的时间与做得不好的孩子在一起。另请记住,这仅对K(X,x_i) 的较高值有意义,它对应于相似的点,比其他点更关注这些点是有意义的。
    • 啊,好吧,有道理!谢谢!
    猜你喜欢
    • 2023-03-11
    • 2016-04-01
    • 1970-01-01
    • 1970-01-01
    • 2016-01-23
    • 1970-01-01
    • 1970-01-01
    • 2014-02-24
    • 1970-01-01
    相关资源
    最近更新 更多