【发布时间】:2013-02-05 16:34:49
【问题描述】:
我是生物学家,对 Python 非常陌生,在此之前,我学了一点 R。
所以我有一个非常大的文本文件(3 GB,在 R 中太大而无法处理),所有值都用逗号分隔,但扩展名是 .txt(我不知道这是否是必要的信息)。我想做的是:
将它作为一个对象读入python,相当于R中的数据框, 摆脱中间的列 减小对象的大小 写成txt文件
把剩下的带到 R.
如果你能帮助我,我会很高兴。 谢谢
【问题讨论】:
-
我推荐CSV module。
-
对我来说,这看起来更像是
perl甚至sed的工作......如果没有看到至少一行并确切了解删除内部列的规则是什么,很难说...... -
R 中
sqldf包中的read.csv.sql可能有用:code.google.com/p/sqldf。您可以使用 SQL 仅从 csv 中提取必填字段。我有一些大文件的运气,但没有你那么大。 -
或 unix 命令行:
cut -f 1-3,8-12 -d, < bigfile.txt >smallerfile.txt(如果引号中有逗号,可能会失败)