【发布时间】:2020-02-16 15:01:10
【问题描述】:
所以我目前正在完成有关泰坦尼克数据集 (https://www.kaggle.com/c/titanic/data) 的教程。 现在我正在尝试一些可能相关的新事物。
它的信息是: 有 891 个条目(红色星号),以及 具有 NaN 值的列(蓝色短划线)。
当我去查找缺失值的小摘要时,我被.sum() 和.count() 弄糊涂了:
在上面的代码中,.sum() 每出现一个空值就加一。因此,输出似乎是数据框中每列缺少多少条目的值。 (这是我想要的)
然而如果我们使用.count(),无论我们使用.isnull().count() 还是.notnull().count(),每列都会得到891。
所以我的问题是:
.count() 在这种情况下是什么意思?
我认为它会计算所需方法的每个实例(在这种情况下,每个实例都是 null 或非 null 条目;基本上是 .sum() 所做的)。
还有;我对如何使用.sum() 的“定义”,对吗?
【问题讨论】: