【发布时间】:2019-08-06 13:39:19
【问题描述】:
我试图了解df.persist() 在dask 中的工作原理。我会再次构建相同的表达式,它会重新计算它还是从缓存中加载它?
例如当我这样做时会发生什么:
ddf = dask.dataframe.read_csv('my.csv').shift(1).persist()
print(ddf.sum().compute())
del ddf
ddf = dask.dataframe.read_csv('my.csv').shift(1).persist()
print(ddf.mean().compute())
dask 是读取.csv 并移动两次,还是第二次来自缓存?我需要第二个.persist() 吗?如果它保留在缓存中,我如何强制清理缓存?
【问题讨论】:
标签: python pandas dataframe bigdata dask