【发布时间】:2021-12-09 00:22:26
【问题描述】:
我有一个大文件 50G,我想获取 重复行 和 文件的其余部分 我使用两个命令来获取结果这需要很长时间。
sort file.tsv | uniq -d > duplicateList.tsv
sort file.tsv | uniq -u > clean_List.tsv
您可以看到该过程重复了两次,我只想制作一个命令并返回两个结果而不使用重复的命令
注意我可以使用 linux commande 或 Python 脚本
【问题讨论】:
-
您是否尝试过使用
tee将您的文件内容通过管道传输到不同的消费者/文件? -
是的,我试过 tee ,但没有解决我的问题
-
请定义“很长时间”。请准确说明您是如何使用
tee以及如何/为什么“不起作用”。请显示您的 TSV 文件的几个代表性行。谢谢。 -
我的意思是“很长时间”该过程运行两次,例如,如果第一个命令需要 15 分钟,我需要运行下一个命令并且需要 15 分钟,我想将重复的电子邮件保存在名为 duplicateList 的文件中.tsv 并在同一操作中在名为 clean_List.tsv 的文件夹中保存不重复的电子邮件,我的 TSV 文件格式是电子邮件列表 aa@email.com