awk - 如何匹配模式然后复制多行?

标签 awk ksh

我有两个正在处理的文件。第一个文件是我必须搜索的主数据库文件。第二个文件是我可以创建的文件,它允许我从主数据库中命名我想要提取的项目。我设法制作了一个 AWK 解决方案,它将搜索主数据库并提取与第二个文件匹配的确切行。但是,我无法弄清楚如何将匹配后的行复制到我的新文件中。
主数据库看起来像这样:

40005X/50005/60005/3/10/9/  
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40006X/50006/60006/3/10/3/
10047A/20047/30047/0/5/23./XXXX/
10048A/20048/30048/0/5/23./XXXX/
10049A/20049/30049/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/
40009X/50009/60009/3/10/3/
10054A/20054/30054/0/5/23./XXXX/
10055A/20055/30055/0/5/23./XXXX/
10056A/20056/30056/0/5/23./XXXX/
40010X/50010/60010/3/10/3/
10057A/20057/30057/0/5/23./XXXX/
10058A/20058/30058/0/5/23./XXXX/
10059A/20059/30059/0/5/23./XXXX/
在我的示例中,以 4000 开头的行是我匹配的第一行。该行的最后一个数字告诉我要复制多少行。因此,在第一行 40005X/50005/60005/3/10/9/ 中,我将匹配 40005X,该行中的 9 告诉我下面有 9 行需要与它一起复制。
第二个文件非常简单,看起来像这样:
40005X
40007X
40008X
当脚本找到每个匹配项时,我想将信息从第一个文件移动到一个新文件以进行分析。最终结果如下所示:
40005X/50005/60005/3/10/9/
10038A/20038/30038/0/5/23./XXXX/
10039A/20039/30039/0/5/23./XXXX/
10040A/20040/30040/0/5/23./XXXX/
10041A/20041/30041/0/5/23./XXXX/
10042A/20042/30042/0/5/23./XXXX/
10043A/20043/30043/0/5/23./XXXX/
10044A/20044/30044/0/5/23./XXXX/
10045A/20045/30045/0/5/23./XXXX/
10046A/20046/30046/0/5/23./XXXX/
40007X/50007/60007/3/10/3/
10050A/20050/30050/0/5/23./XXXX/
10051A/20051/30051/0/5/23./XXXX/
10052A/20052/30052/0/5/23./XXXX/
40008X/50008/60008/3/10/1/
10053A/20053/30053/0/5/23./XXXX/
我目前拥有的与第一行匹配的代码是这样的:
#! /bin/ksh

file1=input_file
file2=input_masterdb
file3=output_test

awk -F'/' 'NR==FNR {id[$1]; next} $1 in id' $file1 $file2 > $file3
我在 AWK 方面取得了最大的成功,但是我愿意接受任何建议。但是,我正在 UNIX 系统上处理此问题。我想将它保留为 KSH 脚本,因为我使用的大多数其他脚本都是以这种格式编写的,而且我最熟悉它。
感谢您的帮助!!

最佳答案

您现有的 awk 与 ids 文件中的行正确匹配,您现在需要添加一个条件以在读取匹配行的最后一个字段后打印 N 行。因此,我们将变量 p 设置为要打印的行数加一(当前行数),并减少每行打印。

awk -F'/' 'NR==FNR{id[$0]; next} $1 in id{p=$6+1} p-->0{print}' file1 file2
或与最后一个条件相同,更“糟糕”(由 Ed Morton)并涵盖大文件的任何可能的极端情况
awk -F'/' 'NR==FNR{id[$0]; next} $1 in id{p=$6+1} p&&p--' file1 file2
这里省略了 print 条件,因为它是默认操作,只要减少 p 为正,条件就会再次为真。

关于awk - 如何匹配模式然后复制多行?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/63418185/

相关文章:

linux - 如何根据第 6 个字段内容 grep 行

c - 在 Korn shell 脚本中将斜杠替换为单词 'slash'

linux - KornShell 脚本中的 if 语句

Unix - 第 9 个逗号后分割线

bash - Docker-Compose中的唯一ID参数

linux - 使用 sed 或 awk 将第一行中的一个词替换为第二行中的另一个词

linux - AWK - 无法替换值

AWK输出问题

perl - 如何检查文件大小并将结果添加到 Perl 中的 Excel 电子表格中?

bash - 如何在 bash/zsh/ksh 中复制期间创建目录?