【发布时间】:2020-09-24 12:02:24
【问题描述】:
我有一个大约 5 GB 的多 json 文件,我对它进行了一些探索性数据分析。问题是每次我加载文件时,使用这段代码大约需要 1 分钟的时间来加载它:
with open(json_fn, 'r') as f: # multiple jsons in one file! (one per line)
for line in f:
data = json.loads(line)
有没有更有效的方法来存储这些数据以便在 python 中加载?我在考虑泡菜(因为它是一种通常更快的二进制格式)但是it seems to be even slower。有什么建议可以用来避免每次等待 1 分钟吗?
【问题讨论】:
-
pickle的目的是保存和恢复任意 Python 对象,而不是高效地存储文本数据。 -
如果行具有相同(或基本相同)的结构,是否可以将它们存储在适当的数据库中?如果你可以腌制,你当然可以推送到 MySQL、sqlite 或其他任何东西。
-
如果你的数据不需要引用并且你被普通文件困住,那么即使是 csv 也会有意义(解析更简单):-D
标签: python json storage pickle