【问题标题】:How to determine relationship or correlation among categorical input variables or between input and output var in classification?如何确定分类输入变量之间或分类中输入和输出var之间的关系或相关性?
【发布时间】:2017-12-01 10:53:45
【问题描述】:

我开始自学机器学习。

我有一组输入变量(分类和连续):工作(退休、经理、技术员等)教育(高中、未知、学士、硕士等)、接触时间、年龄、婚姻;等等......输出变量(是或否)(同意购买新产品?)

首先我想分析数据集,但是我不知道如何在python中找到离散输入数据的输入和输出变量之间的相关性?

我应该清除所有丢失的数据(未知)吗?

【问题讨论】:

    标签: python-3.x machine-learning


    【解决方案1】:

    想到两件事: 1. 看看特征是如何相关的 2. 看看已购买与未购买的统计分布是什么样的

    特征相关性

    import pandas as pd
    import seaborn as sns
    
    df = pd.DataFrame({
            'job': ['retired', 'retired', 'manager', 'manager', 'manager', 'technician', 'technician', None, None],
            'education': ['high', 'high', 'master', 'unknown', 'master', 'master', 'high', 'unknown', 'master'],
            'duration_of_contact': [3, 1, 5, 3, 1, 9 ,8, 3, 1],
            'age': [50, 65, 30, 29, 38, 42, 25, 10, 10],
            'married': [1, 1, 0, 1, 0, 1, 0, 0, 0],
            'purchase': [0, 0, 1, 1, 1, 0, 0, 1, 1]
        })
    
    sns.heatmap(df.corr())
    

    统计属性

    您可以查看购买为真和购买为假时两种情况的分布:

    sns.boxplot(x="purchase", y="age", data=df)
    

    查看更多可以从 seaborn 使用的地块:https://seaborn.pydata.org/tutorial/categorical.html

    【讨论】:

      猜你喜欢
      • 2017-09-28
      • 1970-01-01
      • 1970-01-01
      • 2021-01-19
      • 2018-08-15
      • 2016-04-11
      • 2017-11-25
      • 2022-10-04
      • 2018-05-08
      相关资源
      最近更新 更多