【发布时间】:2020-07-20 05:17:26
【问题描述】:
我正在使用来自 kaggle 的 jupyter 笔记本,当我将它下载到我的本地机器时,它会因为一些奇怪的数据类型行为而中断。
train = pd.read_csv('../dataset/train.csv')
print(train["BsmtFinSF2"].dtype, train["BsmtFinSF2"].describe().dtype)
>>> int64 float64
谁能解释为什么这些值不同?
.csv 可用: https://www.kaggle.com/c/house-prices-advanced-regression-techniques/data?select=train.csv
【问题讨论】:
-
这有什么问题?
-
我可以将 csv 读入 pandas 并运行 describe 没有任何问题。到底是什么问题?
-
为什么它们应该相同?
df.dtype给出了df的dtype,而df.describe().dtype给出了一个新的数据框,其中包含计数、标准、平均值、最小值、25% 等可以是浮动的。 -
在代码中发生了其他事情,我的一个变量在应该是整数时被分成几类——仍然没有弄清楚,但这不是问题,
标签: python-3.x pandas jupyter-notebook