【发布时间】:2018-07-04 15:15:08
【问题描述】:
我正在研究一些 datasets 包含许多 DateTime 变量。我总是在数据清理后保存一个.csv 文件。但是,当我下次将文件加载到pandas时,我必须再次转换dtypes,并且需要很长时间。因此,我想知道是否有一种类型的文件可以用 Pandas 保存以避免这种情况。
【问题讨论】:
-
如何保存和加载的示例代码将帮助那些想帮助你的人。
我正在研究一些 datasets 包含许多 DateTime 变量。我总是在数据清理后保存一个.csv 文件。但是,当我下次将文件加载到pandas时,我必须再次转换dtypes,并且需要很长时间。因此,我想知道是否有一种类型的文件可以用 Pandas 保存以避免这种情况。
【问题讨论】:
您可以使用pickle 序列化您的对象。谢天谢地pandas 有一个原生函数来序列化和导出你的数据帧。只需导出使用
df.to_pickle('your_file.pkl')
来自文档:https://pandas.pydata.org/pandas-docs/stable/generated/pandas.DataFrame.to_pickle.html
然后,您可以使用
再次加载您的 DataFramedf = pandas.read_pickle('your_file.pkl')
【讨论】: