【问题标题】:Is pandas 'corr()' applied to automatic data normalization?pandas 'corr()' 是否应用于自动数据规范化?
【发布时间】:2021-03-12 07:38:37
【问题描述】:

我已经多次使用 pandas corr() 方法。但我不知道 pandas corr() 是否应用了自动数据规范化。我知道必须在数据归一化之后进行关联。

我的问题是,如果我使用 pandas corr() 方法来检查数据帧中各个列之间的 pearson 相关性,那么 pandas corr() 方法是否会自行应用数据规范化?

我尝试使用来自 scikit-learn 的 StandardScaler 进行检查。数据归一化后的相关性与未应用归一化后的相关性相同。

[在我尝试过之后]
哦..我尝试使用 Scikit-learn StandardScaler 检查它。之后,后者的系数等于前者。也许 pandas corr() 会自动使用数据规范化。

【问题讨论】:

    标签: python pandas


    【解决方案1】:

    我不知道你的意思是什么

    我知道关联必须在数据之后进行 标准化。

    如果您进行 spearman 相关,则无需标准化您的变量。

    您很可能指的是皮尔逊相关性。来自wiki,是:

    两个变量的协方差,除以它们的乘积 标准偏差;因此它本质上是一个标准化的测量 的协方差,使得​​结果始终具有介于 -1 之间的值 和 1

    因此,在 spearman 的任何计算中,都有一个步骤可以根据您的标准差进行缩放。

    如果您事先使用StandardScaler() 对变量进行缩放,那么您只是将变量除以它们的标准差,这当然不会改变结果。

    【讨论】:

    • 感谢您的回答!是的!我的意思是皮尔逊相关性。我应该提到皮尔逊等具体的相关性。由于你,我知道了标准化不需要在 spearman 中完成的新事实。谢谢!
    猜你喜欢
    • 2016-06-04
    • 2012-09-13
    • 1970-01-01
    • 2018-07-08
    • 1970-01-01
    • 1970-01-01
    • 2013-06-30
    • 2019-12-22
    • 2011-03-06
    相关资源
    最近更新 更多