【发布时间】:2012-09-06 20:15:22
【问题描述】:
我有一个应用程序,它使用标准 JSON 工具定期将 JSON 文件转储并加载到 Python 中。
在早期,我们决定将加载的 JSON 数据作为对象而不是字典来处理要方便得多。这实际上归结为“点”成员访问的便利性,而不是字典键查找的[] 符号。 Javascript 的优点之一是字典查找和成员数据访问之间没有真正的区别(我猜这就是 JSON 特别适合 Javascript 的原因)。但在 Python 中,字典键和对象数据成员是不同的东西。
因此,我们的解决方案是使用自定义 JSON 解码器,该解码器使用 object_hook 函数返回对象而不是字典。
我们从此过上了幸福的生活……直到现在,这个设计决定可能被证明是一个错误。您会看到,现在 JSON 转储文件变得相当大(> 400 MB)。据我所知,标准的 Python 3 JSON 工具使用本机代码来进行实际解析,因此它们非常快。但是,如果您提供自定义 object_hook,它仍然必须为每个解码的 JSON 对象执行解释的字节码 - 这严重减慢了速度。如果没有object_hook,解码整个 400 MB 文件只需大约 20 秒。但是用钩子的话,需要半个多小时!
所以,此时我想到了 2 个选项,这两个选项都不是很令人愉快。一种是忘记使用“点”成员数据访问的便利性,而只使用 Python 字典。 (这意味着要更改大量代码。)另一个是编写一个 C 扩展模块并将其用作object_hook,看看我们是否得到任何加速。
我想知道是否有一些我没有想到的更好的解决方案 - 也许是一种更简单的方法来获得“点”成员访问权限,同时仍然最初解码为 Python 字典。
对这个问题有什么建议和解决方案吗?
【问题讨论】:
-
它必须是 JSON 吗?您可以考虑使用
picklemodule;它可以让你存储和恢复整个 python 对象。shelve和marshall也可能满足您的需求。 -
在用 C 语言编写之前,您可以尝试cython。
-
尝试分析代码并优化?
-
@Martijn Peters,使用 JSON 是与应用程序之外的数据互操作性的原始要求。不幸的是,Python 特定的泡菜格式不是一个选项。
-
@Channel72:好的,要求就是要求。
标签: python json python-3.x