【发布时间】:2012-06-21 07:52:52
【问题描述】:
我想在 awk 中解决以下问题。我有一个大文本表,逗号分隔,由 100k 行和 5k 列组成。第一行是标题,第一列是记录 ID。然后我有第二个文本文件,其中包含第一个文件中标题的子集。我想提取第一个文件的所有列,其标题包含在第二个文件中给出的列表中。这是输入和所需输出的示例:
数据.TXT
ID, head1, head2, head3, head4
1, 25.5, 1364.0, 22.5, 13.2
2, 10.1, 215.56, 1.15, 22.2
LIST.TXT
head1
head4
期望的输出:
ID, head1, head4
1, 25.5, 13.2
2, 10.1, 22.2
任何人都可以给我一些关于如何在 awk 或通过 unix 脚本解决这个问题的建议?提前感谢您的帮助!
【问题讨论】:
-
您想要 LIST.TXT 文件中的 ID 吗? (如果您可以包含它,它将简化解决方案)。祝你好运。 (如果这是真的,请编辑您的问题)。
-
@shellter 在我的情况下,解决方案比现在更简单:)
-
不,LIST.TXT 没有任何 ID 字段,按原样提供。输出中的 ID 是 DATA.TXT 中的 ID。 @Lev 您的解决方案确实(显然)很简单。一旦我明白为什么每个符号都在它所在的位置! :)