【发布时间】:2020-05-23 05:42:31
【问题描述】:
使用表格数据进行回归任务的半监督学习?我有 20K 标记数据和 200K 未标记数据。
模型通过半监督学习变得越来越好,例如。自我学习,最重要的是,如果您只有 20K 并且对 200K 进行预测,您假设方差和特征分布保持不变,这并不总是正确的,因此即使您的模型在 K 上的平均 R2 为 90,您也会做出相当大的错误预测折叠简历。希望这能解释为什么我要寻找一种半监督的回归方法!
【问题讨论】:
-
你为什么说它是半监督的。你有 20K 记录来训练你的模型,剩下的你应该执行预测
-
@SwaritAgarwal 模型通过半监督学习变得越来越好,例如。自我学习,最重要的是,如果您只有 20K 并且对 200K 进行预测,您假设方差和特征分布保持不变,这并不总是正确的,因此即使您的模型在 K 上的平均 R2 为 90,您也会做出相当大的错误预测折叠简历。希望这能解释为什么我要寻找一种半监督的回归方法!
-
有道理。但是您的 20K 记录的准确性和 R2 是多少。我相信更多的数据确实可以改善您的模型。尝试岭回归。希望能解决您的疑虑
-
好吧,我的 K Fold R2 在 20K 数据上相当高,我正在尝试所有非线性模型,如 XGBoost、神经网络等。Ridge 是线性模型,无济于事
-
问题会是什么?您能否更新问题以添加您在 cmets 中提供的所有信息并提出一个有意义的问题。通过在 LapSVM 之上重新编码简单的回归算法(例如回归的 kmean),具有流形正则化的半监督学习分类可能会有所帮助。
标签: machine-learning regression data-science tabular non-linear-regression