【发布时间】:2022-01-10 15:37:39
【问题描述】:
我想通过查看典型的共同特征来了解我们的客户(例如“40 多岁的已婚客户喜欢葡萄酒”)。这将对应于项集 {Married, 40s, Wine}。
如何创建一个名为 customer_data_onehot 的新数据框,使行对应于客户(如在原始数据集中),列对应于数据中十个分类属性中的每一个的类别。新数据框应仅包含布尔值(True/False 或 0/1s),使得行中的值 ????和列????为真(或 1)当且仅当属性值对应于列 ????持有对应于行的客户???? .显示数据框。
我有这个提示“提示:例如,对于属性“教育”,有 5 个可能的类别:“毕业”、“博士”、“硕士”、“基础”、“2n 周期”。因此,新的数据框必须包含每个属性值的一列。”但我不明白我怎样才能做到这一点。
有人可以指导我在这里找到正确的解决方案吗?
我有这段代码可以导入 csv 文件并从原始数据集中选择 90% 的数据。
import pandas as pd
pre_process = pd.read_csv('customer_data.csv')
pre_process = pre_process.sample(frac=0.9, random_state=413808).to_csv('customer_data_2.csv',
index=False)
【问题讨论】: