【问题标题】:Semi supervised learning for Regression task with tabular data?使用表格数据进行回归任务的半监督学习?
【发布时间】:2020-05-23 05:42:31
【问题描述】:
  • 使用表格数据进行回归任务的半监督学习?我有 20K 标记数据和 200K 未标记数据。

  • 模型通过半监督学习变得越来越好,例如。自我学习,最重要的是,如果您只有 20K 并且对 200K 进行预测,您假设方差和特征分布保持不变,这并不总是正确的,因此即使您的模型在 K 上的平均 R2 为 90,您也会做出相当大的错误预测折叠简历。希望这能解释为什么我要寻找一种半监督的回归方法!

【问题讨论】:

  • 你为什么说它是半监督的。你有 20K 记录来训练你的模型,剩下的你应该执行预测
  • @SwaritAgarwal 模型通过半监督学习变得越来越好,例如。自我学习,最重要的是,如果您只有 20K 并且对 200K 进行预测,您假设方差和特征分布保持不变,这并不总是正确的,因此即使您的模型在 K 上的平均 R2 为 90,您也会做出相当大的错误预测折叠简历。希望这能解释为什么我要寻找一种半监督的回归方法!
  • 有道理。但是您的 20K 记录的准确性和 R2 是多少。我相信更多的数据确实可以改善您的模型。尝试岭回归。希望能解决您的疑虑
  • 好吧,我的 K Fold R2 在 20K 数据上相当高,我正在尝试所有非线性模型,如 XGBoost、神经网络等。Ridge 是线性模型,无济于事
  • 问题会是什么?您能否更新问题以添加您在 cmets 中提供的所有信息并提出一个有意义的问题。通过在 LapSVM 之上重新编码简单的回归算法(例如回归的 kmean),具有流形正则化的半监督学习分类可能会有所帮助。

标签: machine-learning regression data-science tabular non-linear-regression


【解决方案1】:

大多数半监督学习 (SSL) 的一个关键假设是附近的点(例如,在未标记点和已标记点之间)可能共享相同的标签。您似乎期望未标记集的方差和分布与标记集不同,这可能违反了上述假设。

如果您仍然希望继续使用 SSL,那么回归方法没有传统技术。但是……

对不太常规方法的文献进行了回顾:https://www.researchgate.net/publication/325798856_Semi-supervised_regression_A_recent_review

还有……

您始终可以转换为分类方法(如果标签分布相对均匀,这会有所帮助)。例如,只需在您的标记集中选择中值预测值,那么小于该值的所有值都为 0,大于该值的所有值都为 1。然后您可以应用传统的分类 SSL 技术,例如标签传播。然后,您获得测试集上的预测概率(例如,使用predict_proba())并将其缩放回您的回归范围。例如,如果标记集中的最小值为 0,最大值为 10,则只需将预测概率乘以 10。

希望以上内容至少可以提供思考。

【讨论】:

    猜你喜欢
    • 2014-04-20
    • 2017-02-28
    • 2015-06-01
    • 2012-11-08
    • 2014-12-05
    • 2018-07-28
    • 1970-01-01
    • 2013-03-24
    • 2017-12-29
    相关资源
    最近更新 更多