【问题标题】:Spark returns (LogisticRegression) model with scaled coefficients具有缩放系数的 Spark 返回 (LogisticRegression) 模型
【发布时间】:2015-11-18 10:47:10
【问题描述】:

我正在对综合生成的数据测试LogisticRegression 的性能。我输入的权重是

   w = [2, 3, 4]

没有拦截和三个功能。在对1000 综合生成的数据点进行训练后,假设每个数据点都是随机正态分布,我获得的 Spark LogisticRegression 模型的权重为

 [6.005520656096823,9.35980263762698,12.203400879214152]

我可以看到每个权重都按接近 '3' w.r.t 的因子进行缩放。原始值。我无法猜测这背后的原因。代码很简单

/*
 * Logistic Regression model
 */
 val lr = new LogisticRegression()
  .setMaxIter(50)
  .setRegParam(0.001)
  .setElasticNetParam(0.95)
  .setFitIntercept(false)

 val lrModel = lr.fit(trainingData)


 println(s"${lrModel.weights}")

如果有人能阐明这里的可疑之处,我将不胜感激。

诚挚的问候, 尼基尔

【问题讨论】:

    标签: scala apache-spark apache-spark-ml


    【解决方案1】:

    我发现了问题:我是完美可分离性的受害者,因为我的采样器工作不正常,结果数据完全是确定性的。因此,Logistic 回归过度拟合了训练数据。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-08-22
      • 1970-01-01
      • 2020-11-15
      • 1970-01-01
      • 2016-05-18
      • 1970-01-01
      • 2017-07-16
      相关资源
      最近更新 更多