【问题标题】:Pandas: type of file to save to contain dtypesPandas:要保存以包含 dtypes 的文件类型
【发布时间】:2018-07-04 15:15:08
【问题描述】:

我正在研究一些 datasets 包含许多 DateTime 变量。我总是在数据清理后保存一个.csv 文件。但是,当我下次将文件加载到pandas时,我必须再次转换dtypes,并且需要很长时间。因此,我想知道是否有一种类型的文件可以用 Pandas 保存以避免这种情况。

【问题讨论】:

  • 如何保存和加载的示例代码将帮助那些想帮助你的人。

标签: python pandas file


【解决方案1】:

您可以使用pickle 序列化您的对象。谢天谢地pandas 有一个原生函数来序列化和导出你的数据帧。只需导出使用

df.to_pickle('your_file.pkl')

来自文档:https://pandas.pydata.org/pandas-docs/stable/generated/pandas.DataFrame.to_pickle.html

然后,您可以使用

再次加载您的 DataFrame
df = pandas.read_pickle('your_file.pkl')

【讨论】:

  • 刚刚尝试保存一个 .pkl 文件并且它可以工作并且所有 dtypes 都被保存了。同时,文件大小几乎比具有相同数据的 .csv 小四倍。但是,我想知道保存 pkl.file 是否有任何缺点,因为我以前从未听说过。
  • 不,使用 pkl 文件没有缺点。我想如果您只想保存数据而不是对象,那么 csv 更合适。如果您的问题得到解答,请记得将其标记为已接受。
  • 一个可能的缺点是我相信用一个版本的 Pandas 保存 pkl 并用另一个版本打开它会发出警告。它也可能有意外行为(?否则警告永远不会存在)
猜你喜欢
  • 1970-01-01
  • 2018-05-31
  • 2019-08-16
  • 2014-03-20
  • 2020-08-06
  • 2018-10-29
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多