【问题标题】:More efficient to merge data-frames or merge dictionaries? [closed]合并数据框或合并字典更有效? [关闭]
【发布时间】:2021-12-03 21:44:19
【问题描述】:

我需要遍历许多 JSON 文件,提取我需要的(某些)数据,并以一个代表所有文件数据的大型数据框结束。我的问题是,我应该从每个文件中收集数据作为字典并继续使用后续文件更新该字典,还是将每个文件字典转换为数据框并一次将它们连接起来?或者有没有更好更有效的方法?谢谢。

编辑:数据是嵌套的,我已经对其进行了一些处理/清理。到目前为止,我一直在迭代文件,将数据读入字典,使用 pd.json_normalize 取消嵌套数据,应用(pd.Series)扩展列表值数据,每个文件保存为一个数据帧,然后连接每个文件的数据帧。

【问题讨论】:

  • 数据是什么样的?如果 json 是嵌套的,Ik 会产生很大的不同。另外:到目前为止,您尝试过什么?
  • 它是嵌套的,我已经对其进行了一些处理/清理。到目前为止,我一直在迭代文件,将数据读入字典,使用 pd.json_normalize 取消嵌套数据,应用(pd.Series)扩展列表值数据,每个文件保存为一个数据帧,然后连接每个文件的数据帧。
  • 在这种情况下,您确实需要指定此问题,添加示例数据和代码,并指出您在流程中遇到的问题。
  • 您能否包含您目前使用的代码以及您的 JSON 文件示例?如果不测量实现,这很难回答。您只会得到基于意见的回复,例如来自@DhyanilMehta 的回复,没有任何来源或可重复性。
  • 我没有被卡住,我只是好奇将每个文件中的数据帧连接起来是否是最佳选择,或者将它们转换为字典并更新一个大字典,然后将其转换为数据- 处理结束时的帧。

标签: python json pandas performance


【解决方案1】:

更新字典将比连接数据帧更有效,因为数据帧会带来管理索引的开销,而字典是作为哈希表实现的。

【讨论】:

    猜你喜欢
    • 2015-07-25
    • 2020-12-23
    • 2021-12-28
    • 2021-02-27
    • 2016-03-08
    • 1970-01-01
    • 2015-04-17
    • 1970-01-01
    • 2013-10-04
    相关资源
    最近更新 更多