【发布时间】:2017-11-23 09:15:11
【问题描述】:
我有一个形状为2701x128 的数据框,它有很多缺失值。问题是有些行可以有 95% 的填充数据,而有些 - 只有 5%。让我试着想象一下:
X 轴是行数(排序后),y 轴是非零值的个数(已排序,类似直方图)
X 轴是列数(排序后),y 轴说明在所有行中有多少非零列(已排序,类似直方图)
我需要:我需要尽可能准确地输入数据,因为这是我需要解决的问题。 问题:我无法使用均值、中位数和其他统计矩对所有内容进行插值,因为它非常粗糙。我也无法创建通常的学习模型,因为缺失数据中没有结构。
您能否建议一些像学习模型一样准确的东西,它可以对分布进行建模,但能够处理完全随机的缺失。因此,显然,主要问题是从这种非结构化未命中创建数据集。我暂时找不到解决方案。
【问题讨论】:
标签: machine-learning imputation