【发布时间】:2019-01-21 13:42:32
【问题描述】:
读取批量 CSV_FILE,如果文件有 500 万,我没有问题 行数,但是如果尝试在大量运行此代码时会出现问题 文件大约 3 亿行,但它对我不起作用,是 有什么方法可以增强代码或块功能来增强 响应时间
import pandas as pd
import timeit
df = pd.read_csv('/home/mahmoudod/Desktop/to_dict/text1.txt'
,dtype='unicode'
,index_col=False
,error_bad_lines=False
,sep = ';'
,low_memory = False
,names =['DATE'
,'IMSI'
,'WEBSITE'
,'LINKUP'
,'LINKDOWN'
,'COUNT'
,'CONNECTION']
)
#df.DATE = pd.to_datetime(df.DATE)
group = df.groupby(['IMSI','WEBSITE']).agg({'DATE':[min,max]
,'LINKUP':'sum'
, 'LINKDOWN':'sum'
, 'COUNT':'max'
,'CONNECTION':'sum'
})
group.to_csv('/home/mahmoudod/Desktop/to_dict/output.txt')
【问题讨论】:
标签: python python-3.x pandas pandas-groupby chunking