【发布时间】:2015-03-08 13:15:07
【问题描述】:
我一遍又一遍地观看Andrew Ng videos,但我仍然不明白如何将梯度下降应用于我的问题。
他几乎只处理高级概念解释领域,但我需要的是基本的战术见解。
我的输入是以下形式的特征向量:
例子:
Document 1 = ["I", "am", "awesome"]
Document 2 = ["I", "am", "great", "great"]
字典是:
["I", "am", "awesome", "great"]
所以作为向量的文档看起来像:
Document 1 = [1, 1, 1, 0]
Document 2 = [1, 1, 0, 2]
根据我看到的梯度下降算法是这样的:
我目前的理解是α是学习率,x(i)是一个特征,在上面的例子中为Document 2,x(3) =2。
y(i) 是标签,在我的情况下,我试图预测与特定特征向量关联的Document,例如 y(0) 将与 Document 1 关联,& y(1) 将代表 Document 2。
可能会有很多文档,比如说 10 个,所以我可以有 5 个与 y(0) 关联的文档和 5 个与 y(1) 关联的文档,在这种情况下m = 10。
首先我不太明白的是,Θ0 & Θ1的作用是什么?
我认为它们是权重值,与感知器算法一样,我将它们应用于特征值,以努力哄该特征,不管其固有值如何,输出标签的值它是关联的。那是对的吗? 所以我一直在将 Θ 值与感知器的权重值相等,这准确吗?
此外,我不明白我们在采用什么梯度。我真的不想再听到关于在山上行走之类的高级解释,实际上,对于我刚刚在上面详述的情况,我们采用什么梯度?两个后续迭代中的权重?一个特征的价值和它的真实标签?
感谢您的考虑,任何见解将不胜感激。
【问题讨论】:
-
您能否编辑您的问题,详细而清晰地描述您的问题是什么以及您要预测什么?我们为您提供的解决方案可能不会使用 Andrew Ng 的视频。
-
这应该至少分成两个问题:你的理论问题和代码。缩小您在代码中遇到的任何问题,并就这些问题提出具体问题。
-
@TimBiegeleisen 我正在尝试预测与词袋特征向量相关的文档
标签: java machine-learning gradient-descent