【问题标题】:Reading Large json.gz files crashes kernel读取大型 json.gz 文件会使内核崩溃
【发布时间】:2020-03-29 00:02:24
【问题描述】:

我有一个 7GB 的数据集。我是这样读的:

path = direc + '2018-01-*.*' ddf = dd.read_json(path,blocksize=None)

我使用这种方法是因为通过 pandas 读取它似乎会导致我的内核不断崩溃并耗尽我的本地内存 - 我正在我的机器上运行它。

我需要进行大量分析,但是如果我保存到镶木地板,或者甚至进行计数或删除重复项,任何命令似乎都会使内核崩溃。

关于如何运行命令/操作此数据集的任何建议?

【问题讨论】:

    标签: memory-management jupyter-notebook kernel dask


    【解决方案1】:

    据我所知,您所做的一切都很好。 Dask 不应该让内核崩溃,在这种情况下可能发生的最坏情况就是内存不足。

    因此您可能需要弄清楚如何简洁地提供更多信息以创建MCVE

    【讨论】:

      猜你喜欢
      • 2018-02-02
      • 1970-01-01
      • 1970-01-01
      • 2018-06-18
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2022-07-07
      相关资源
      最近更新 更多