【发布时间】:2020-03-29 00:02:24
【问题描述】:
我有一个 7GB 的数据集。我是这样读的:
path = direc + '2018-01-*.*'
ddf = dd.read_json(path,blocksize=None)
我使用这种方法是因为通过 pandas 读取它似乎会导致我的内核不断崩溃并耗尽我的本地内存 - 我正在我的机器上运行它。
我需要进行大量分析,但是如果我保存到镶木地板,或者甚至进行计数或删除重复项,任何命令似乎都会使内核崩溃。
关于如何运行命令/操作此数据集的任何建议?
【问题讨论】:
标签: memory-management jupyter-notebook kernel dask