【发布时间】:2017-05-15 12:49:12
【问题描述】:
我有一个包含三列的大型 csv 文件:AID, VID, Rel。
文件大小为 21 GB。
-
我想对它进行排序,使 AID 后跟 Rel。结果应如下所示:
AID VID Rel A 3 0.9 A 4 0.88 A 5 0.87 A 1 0.7 A 2 0.5 A 6 0.4 A 7 0.35 A 8 0.3 B 3 0.9 B 1 0.8 B 2 0.7 B 4 0.6 排序后,我需要一次提取每个 AID“块”,并提取其前 25 个百分位数中的行。
我是处理大数据的新手,不知道该怎么做。
我曾尝试使用 Python pandas,但它一直在崩溃。我也尝试过使用 Python 的 dask,但它没有排序。
如果有帮助,我可以访问 HPC 集群。
【问题讨论】:
-
启动一个 Amazon Redshift 集群,它可以轻松处理 Tera 字节的数据,而且成本几乎为零。
标签: python pandas sorting dask bigdata