【发布时间】:2018-08-22 18:30:29
【问题描述】:
使用 Dash,我们可以轻松读取 CSV 文件并使用 head 获取第一行,即使在多个分区中也是如此。
import dask.dataframe as dd
df = dd.read_csv('data.csv').head(n=100, npartitions=2)
但我想在多个分区上读取 CSV 文件的最后几行,如下所示:
import dask.dataframe as dd
df = dd.read_csv('data.csv').tail(n=100, npartitions=2)
Dask data.frame 似乎不支持tail 方法上的分区。
在pandas 中,我可以使用skiprows 管理它,但在Dask 中似乎没有此选项。
【问题讨论】:
-
既然这个任务不占用大量内存(因此不需要
dask),为什么不使用pandas? -
我的管道基本上使用
dask,但即使我阅读了数百万行(我有一个巨大的 csv 文件......),它也可能是一种选择。
标签: python pandas csv dataframe dask