【问题标题】:Most efficient datatype for iteratively adding to?迭代添加的最有效数据类型?
【发布时间】:2018-10-01 13:56:32
【问题描述】:

我有一个网络爬虫,它可以迭代地从网页中检索数据,我想将拉取的属性添加到 pandas 数据框(最终)以运行简单的统计和分析。每次抓取新页面时,当前脚本都会返回一个字典。

我知道向现有 pandas 数据帧添加新行或新列很慢,所以我的想法是在检索到 csv 时添加字典,然后在收集数据时将此 csv 一次全部转换为数据帧完成(可能几个月后)。我将处理多达 100,000 个字典,包含 18 个键值对。

在这种情况下是否有更有效的方法或数据类型可以使用?

【问题讨论】:

    标签: python-3.x data-science


    【解决方案1】:

    在你的问题中你说when the data collection is finished (possibly months from now)。与 python 或 pandas 或我能想象到的任何其他编程工具的效率相比,这是大量的时间。我刚刚创建了 100k 个长度为 18 的随机字典,其中包含浮点数,将它们保存到文本文件(csv 格式)中,并将 pandas 加载到数据框中。保存需要 2 秒,加载需要 0.5 秒。因此,只需将每条新记录添加到文件中并定期创建您选择的备份。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2011-01-22
      • 1970-01-01
      • 2013-07-05
      • 2013-05-05
      • 1970-01-01
      • 2017-05-29
      • 2015-02-23
      相关资源
      最近更新 更多