【发布时间】:2022-10-21 19:29:10
【问题描述】:
我找到了以下脚本来删除重复项:
awk -F, '!x[$7]++' 'business-records.csv' > 'business-records-deduped.csv'
当它找到重复记录而不是删除所有重复记录并仅保留第一条记录时,如果它可以保留前 2 或 3 条记录并删除其余记录,那就太棒了。所以基本上允许原始和一个重复,但删除超过一两个重复的整行。
如何对其进行调整,使其保留原始记录和第一个重复记录,并删除第一个重复记录之外的所有行?
【问题讨论】:
-
欢迎来到 SO。很好,您清楚地解释了您想要什么,并发布了当前代码。对我来说,使用更少的文本会更容易,并提供一个简单的输入数据 + 所需结果的简短示例。你在书面文本中解释。也许未来的职位?
标签: awk