【问题标题】:IterativeImputer - sample_posteriorIterativeImputer - sample_posterior
【发布时间】:2020-12-11 21:47:53
【问题描述】:

Sklearn 实现了一个名为 IterativeImputer 的计算器。我相信它的工作原理是使用估计器以循环方式预测缺失特征值的值。

它有一个名为 sample_posterior 的参数,但我似乎不知道什么时候应该使用它。

sample_posterior 布尔值,默认=False

是否从每个插补的拟合估计量的(高斯)预测后验中采样。估算器必须支持 如果设置为 True,则在其 predict 方法中返回 return_std。如果使用,则设置为 True 用于多重插补的 IterativeImputer。

我查看了源代码,但我仍然不清楚。如果我有多个要使用迭代估算器填充的功能,我应该使用它还是应该使用它,如果我计划多次使用估算器,例如训练然后验证集?

【问题讨论】:

    标签: python scikit-learn data-science


    【解决方案1】:

    即使有多个功能以及训练和验证/测试集,您也不需要sample_posterior。文档字符串的“多重插补”部分意味着生成多个缺失替换数据集;参见例如wikipedia.

    通常,IterativeImputer 使用基于其他特征(迭代法、循环法等)构建的模型的预测来估算特征的缺失值。如果您使用的模型不仅产生单个预测,而且产生输出分布后验),那么您可以从该分布中随机抽样,因此sample_posterior。通过多次运行它,使用不同的随机种子,这些随机选择是不同的,你会得到多个插补数据集。 这方面的文档不是很好,但有一个(有些陈旧的)PR for an extended example 和一个toy example on SO

    【讨论】:

    猜你喜欢
    • 2019-09-14
    • 2020-05-30
    • 2020-02-25
    • 2021-01-03
    • 2020-09-08
    • 1970-01-01
    • 2019-03-26
    • 2021-08-23
    相关资源
    最近更新 更多