【发布时间】:2016-04-03 07:18:57
【问题描述】:
我正在尝试将特定文件中的字段分解为一个数组,然后检查每个术语是否出现在第二个文件中(该文件已存储在另一个数组中)。目标是合并两个文件中的信息。
第一个file1(带有我要拆分的字段的那个)看起来像这样:
data1=data2=data3 some more stuff
data4=data1 this are things
data2=data5 more text here
...
虽然file2 具有这种结构:
data1 10
data2 20
data3 35
data4 15
data5 60
我想使用= 拆分file1 的第一个字段,然后在第二个文件中搜索每个拆分的术语,并按以下格式打印所有内容:
output:
data1=data2=data3 some more stuff 10
data1=data2=data3 some more stuff 20
data1=data2=data3 some more stuff 35
data4=data1 this are things 15
data4=data1 this are things 10
data2=data5 more text here 20
data2=data5 more text here 60
到目前为止,我得到了这个:
awk 'NR==FNR {
l[$1] = $2; next
} {
la=split($1,a,"=")
for(x=1;x<=la;x++)
print $0,l[a[$x]]
}' file2 file1 > output
首先(当NR==FNR 时),我将file2 数据存储在数组l 中,使用第一个字段作为键。
然后我以以下方式解析下一个文件:对于每条记录,我将字段$1 拆分为数组la,使用= 作为分隔符。 la 变量存储数组a 中的词条数。
对于数组a(for循环)中的每个元素,我在数组l中查找对应的键,并输出当前内容+l值。
但是,出于某种原因,我只从file1 获取内容(当前,不需要的输出):
data1=data2=data3 some more stuff
data1=data2=data3 some more stuff
data1=data2=data3 some more stuff
data4=data1 this are things
data4=data1 this are things
data2=data5 more text here
data2=data5 more text here
关于我的代码可能有什么问题的任何想法?
非常感谢!
【问题讨论】:
-
永远不要使用字母
l(el) 作为变量名,因为它看起来太多与数字1(one) 对齐,在某些字体中无法区分。