【发布时间】:2013-05-28 05:48:40
【问题描述】:
我有大约 350 个文本文件(每个文件大约 75MB)。我正在尝试合并所有文件并删除重复的条目。文件格式如下:
ip1,dns1
ip2,dns2
...
我写了一个小shell脚本来做这个
#!/bin/bash
for file in data/*
do
cat "$file" >> dnsFull
done
sort dnsFull > dnsSorted
uniq dnsSorted dnsOut
rm dnsFull dnsSorted
我经常进行此处理,并且想知道下次运行它时是否可以做些什么来改进处理。我对任何编程语言和建议持开放态度。谢谢!
【问题讨论】:
-
你也可以给 sort -ma try --> 它将对单个文件进行排序并相应地合并它们,因此应该节省相当多的时间...... -m 选项可用于场景 espl像这样...即排序 -m 文件* | uniq -u
标签: shell unix text merge duplicate-removal