【发布时间】:2020-02-25 04:27:14
【问题描述】:
我对数据科学和机器学习还比较陌生,目前我正在处理我的第一个项目,其中包含一个非常大的数据集,超过 100 万行和 88 列`。
我目前正在清理数据并尝试使用data.isnull()、.sum() 和data[data.isnull().values.any(axis=1)].head() 等功能,但我的 Jupiter 笔记本文件只会显示前十列和后十列。
只是寻找查看数据的最佳方式或被定向到任何可能有帮助的资源。
【问题讨论】:
-
您在代码中使用了
.head()。这只会给你前 10 列(默认情况下)。还要检查你是否使用.tail(),这只会给出最后 10 个。 -
欢迎堆栈溢出!值得注意的是,这是一个显示功能,而不是错误。您真的希望每次查看数据时都显示一百万行吗?这需要大量滚动,并且有更好的方法来验证您正在做的事情是否正在生效,而无需目视检查 DF
标签: python python-3.x pandas dataframe data-cleaning