【发布时间】:2021-02-01 19:52:01
【问题描述】:
我通常会发现有关使用 Dask 或 Pandas 块大小将数百万行的数据集加载到 python 的问题和讨论,但我的问题有点不同。我有数百万列/功能,只有几千条记录。我发现使用此类数据集的数据加载时间(来自 csv)非常慢,并且消耗大量内存,我做了一些基准测试,有时,pandas 甚至比 dask 还要快!
我测试了我有 100 万行和 300 列的情况,我可以轻松地将它加载到内存中,但是如果我有 300 行和 100 万列,那么 pandas 会消耗所有 64GB RAM 并死掉。
我该如何处理这样的数据集?
非常感谢。
【问题讨论】:
-
@NickODell 在我的回答中看到我的想法。如果您认为这可能是个好主意,请告诉我。不过,我认为您的回答很好。