【发布时间】:2020-12-30 01:21:24
【问题描述】:
我经常收到一个带有, (逗号空格)分隔符的文件,我想将其读入熊猫数据框。简单的pd.read_csv(fname, header=0, sep=', ') 读起来很好,但在我的文件上比等效的sep=',' 慢约8 倍,因为多字符sep 看起来像一个正则表达式并强制python 引擎。
什么是读取具有非正则表达式、多字符分隔符的文件而不需要回退到 python 引擎的好方法(主要指标:快速)?我当前的解决方案(发布在下面)基本上首先在文件上运行s/, /,/g,但这需要两次传递文件。有没有没有这个缺点的首选解决方案?
【问题讨论】: