【发布时间】:2021-07-20 07:14:31
【问题描述】:
我试图从 pandas 数据框中排除一些异常值,但该函数只是返回同一个表而没有任何区别。我不知道为什么。
排除异常值
def exclude_outliers(DataFrame, col_name):
interval = 2.5*DataFrame[col_name].std()
mean = DataFrame[col_name].mean()
m_i = mean + interval
DataFrame = DataFrame[DataFrame[col_name] < m_i]
outlier_column = ['util_linhas_inseguras', 'idade', 'vezes_passou_de_30_59_dias', 'razao_debito', 'salario_mensal', 'numero_linhas_crdto_aberto',
'numero_vezes_passou_90_dias', 'numero_emprestimos_imobiliarios', 'numero_de_vezes_que_passou_60_89_dias', 'numero_de_dependentes']
for col in outlier_column:
exclude_outliers(df_train, col)
df_train.describe()
【问题讨论】:
-
能否粘贴一些示例数据,我们可以复制并运行代码