【发布时间】:2020-02-04 06:13:30
【问题描述】:
我刚开始学习 python,我们被赋予了对 kddcup.data_10_percent 数据集进行数据探索的任务(有些人可能知道这一点)
我决定使用 Panda 查找各种 min、max、std.dev 等。但是,执行 df.mean() 时,内核花了一个多小时并且仍在加载。任何建议都会有所帮助,谢谢。
【问题讨论】:
我刚开始学习 python,我们被赋予了对 kddcup.data_10_percent 数据集进行数据探索的任务(有些人可能知道这一点)
我决定使用 Panda 查找各种 min、max、std.dev 等。但是,执行 df.mean() 时,内核花了一个多小时并且仍在加载。任何建议都会有所帮助,谢谢。
【问题讨论】:
使用df.describe() 获取描述性统计数据,包括汇总数据集的集中趋势、离散度和形状的统计数据,不包括 NaN 值。
df.mean() 的时间还取决于数据集的大小。您可能想获得df['name_of_column'].mean(),它是数据集中某列的平均值。
【讨论】:
df.mean() 往往工作缓慢,在较低级别有一个选项,我们可以通过指定 numeric_only=True 仅计算数据集中存在的数字数据的平均值。
尝试使用 df.mean(numeric_only=True),这样会更快。
-https://pandas.pydata.org/pandas-docs/stable/reference/api/pandas.DataFrame.mean.html
如果这有帮助,请告诉我!
【讨论】: