【发布时间】:2019-04-29 23:52:53
【问题描述】:
我有 2.5 GB 的 data set,其中包含数千万行
我正在尝试加载类似的数据
%%time
import pandas as pd
data=pd.read_csv('C:\\Users\\mahes_000\\Desktop\\yellow.csv',iterator=True,
chunksize=50000)
我得到多个 chunksize 部分并且我正在尝试执行一些操作,例如
%%time
data.get_chunk().head(5)
data.get_chunk().shape
data.get_chunk().drop(['Rate_Code'],axis=1)
对于操作,它选择任何一个块大小部分并执行所有操作。 那么剩下的部分呢? 如何在没有内存错误的情况下对完整数据进行操作。
【问题讨论】:
-
你需要遍历迭代器。
for i in data并执行操作。