【问题标题】:Scikit-learn data indexing and referencingScikit-learn 数据索引和引用
【发布时间】:2019-07-19 13:13:14
【问题描述】:

我使用 GridsearchCV 训练了多个不同的模型。在训练期间,数据排序如下:

[feature 1, feature 2, feature 3, feature 4]

我想使用已保存(使用 joblib 保存)模型来预测新数据。新的/看不见的数据排序如下:

[feature 1, feature 2, feature 4, feature 3]

训练数据和新数据之间的特征相同(即特征 1 表示两个数据集之间的相同事物)。

输入数据的顺序对 scikit 学习有影响吗?它是通过类似于 pandas iloc 的索引引用还是通过类似于 pandas loc 的名称引用?

【问题讨论】:

    标签: python scikit-learn


    【解决方案1】:

    Scikit-learn 模型返回数组。因此,如果您要训练模型、保存模型并稍后使用它按照相同的预处理步骤对不同数据进行预测,那么顺序并保留一份有序特征列表的副本非常重要。

    【讨论】:

      【解决方案2】:

      它应该按索引引用,所以你需要重新索引特征。

      【讨论】:

        猜你喜欢
        • 2020-07-14
        • 1970-01-01
        • 2018-03-19
        • 2021-05-28
        • 2015-11-06
        • 2019-08-08
        • 2016-06-29
        相关资源
        最近更新 更多