【发布时间】:2015-11-21 03:56:44
【问题描述】:
我想做什么:
我想要做的是我有一个大的 .csv 文件。我想根据 BB 列中 HH 列中包含 1 的常见记录以及 HH 列中包含 0 的所有不常见记录,将这个大 csv 文件分解为许多小文件。
因此,所有文件将在 BB 列中包含 HH 列中包含 1 的常见记录,以及在 BB 列中没有记录且在 HH 列中包含 0 的所有不常见记录。文件名应以第 2 列(BB)的公共记录为基础。请看下面的场景。 任何建议想法都受到高度赞赏。
大文件.csv:
AA BB CC DD EE FF GG HH
12 53 115 10 3 3 186 1
12 53 01e 23 3 2 1
12 53 0ce 65 1 3 1
12 53 173 73 4 2 1
12 59 115 0 3 3 186 1
12 59 125 0 3 3 186 1
12 61 01e 23 3 2 1
12 61 b6f 0 1 1 1
12 61 b1b 0 6 5 960 1
12 68b 95 3 5 334 0
12 31a 31 2 2 0
12 221 0 4 5 0
12 12b 25 5 4 215 0
12 a10 36 5 1 0
我的预期结果文件如下:
53.csv:
AA BB CC DD EE FF GG HH
12 53 115 10 3 3 186 1
12 53 01e 23 3 2 1
12 53 0ce 65 1 3 1
12 53 173 73 4 2 1
12 68b 95 3 5 334 0
12 31a 31 2 2 0
12 221 0 4 5 0
12 12b 25 5 4 215 0
12 a10 36 5 1 0
59.csv:
AA BB CC DD EE FF GG HH
12 59 115 0 3 3 186 1
12 59 125 0 3 3 186 1
12 68b 95 3 5 334 0
12 31a 31 2 2 0
12 221 0 4 5 0
12 12b 25 5 4 215 0
12 a10 36 5 1 0
61.csv:
AA BB CC DD EE FF GG HH
12 61 01e 23 3 2 1
12 61 b6f 0 1 1 1
12 61 b1b 0 6 5 960 1
12 68b 95 3 5 334 0
12 31a 31 2 2 0
12 221 0 4 5 0
12 12b 25 5 4 215 0
12 a10 36 5 1 0
【问题讨论】:
-
那么到目前为止,您尝试过什么? Stack Overflow 不是代码编写服务。
-
为什么第一个文件中包含 BB=33?
-
33 是输入错误,已修改。