【问题标题】:Python Find the Mean using Panda LibraryPython 使用 Panda 库求均值
【发布时间】:2020-02-04 06:13:30
【问题描述】:

我刚开始学习 python,我们被赋予了对 kddcup.data_10_percent 数据集进行数据探索的任务(有些人可能知道这一点)

我决定使用 Panda 查找各种 min、max、std.dev 等。但是,执行 df.mean() 时,内核花了一个多小时并且仍在加载。任何建议都会有所帮助,谢谢。

【问题讨论】:

标签: python pandas


【解决方案1】:

使用df.describe() 获取描述性统计数据,包括汇总数据集的集中趋势、离散度和形状的统计数据,不包括 NaN 值。

df.mean() 的时间还取决于数据集的大小。您可能想获得df['name_of_column'].mean(),它是数据集中某列的平均值。

【讨论】:

    【解决方案2】:

    df.mean() 往往工作缓慢,在较低级别有一个选项,我们可以通过指定 numeric_only=True 仅计算数据集中存在的数字数据的平均值。

    尝试使用 df.mean(numeric_only=True),这样会更快。

    -https://pandas.pydata.org/pandas-docs/stable/reference/api/pandas.DataFrame.mean.html

    如果这有帮助,请告诉我!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2017-04-14
      • 1970-01-01
      • 2016-12-25
      • 2012-10-01
      • 2019-08-19
      • 1970-01-01
      • 2022-12-04
      • 2019-04-17
      相关资源
      最近更新 更多