作为 awk
的初学者,我能够通过
awk -F, '{print >> $1".csv";close($1)}' myfile.csv
但我想根据附加条件(即特定列中唯一值的出现)拆分大型 CSV 文件。
具体来说,有输入
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
我希望输出文件是
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
和
444,1,1,1
444,1,0,1
555,1,1,1
666,1,0,0
每个都包含三个(在本例中)第一列中的唯一值,分别为111,222,333
和444,555,666
。
任何帮助将不胜感激。
最佳答案
这就能解决问题,我发现它非常可读且易于理解:
awk -F',' 'BEGIN { count=0; filename=1 }
x[$1]++==0 {count++}
count==4 { count=1; filename++}
{print >> filename".csv"; close(filename".csv");}' file
我们从计数 0 开始,文件名从 1 开始。然后,我们对从第一列获得的每个唯一值进行计数,每当出现第四个值时,我们就会重置计数并移至下一个文件名。
这是我使用的一些示例数据,这只是您的数据,还有一些附加行。
~$ cat test.txt
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
777,1,1,1
777,1,0,1
777,1,1,0
777,1,1,1
888,1,0,1
888,1,1,1
999,1,1,1
999,0,0,0
999,0,0,1
101,0,0,0
102,0,0,0
像这样运行 awk:
~$ awk -F',' 'BEGIN { count=0; filename=1 }
x[$1]++==0 {count++}
count==4 { count=1; filename++}
{print >> filename".csv"; close(filename".csv");}' test.txt
我们看到以下输出文件和内容:
~$ cat 1.csv
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
~$ cat 2.csv
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
~$ cat 3.csv
777,1,1,1
777,1,0,1
777,1,1,0
777,1,1,1
888,1,0,1
888,1,1,1
999,1,1,1
999,0,0,0
999,0,0,1
~$ cat 4.csv
101,0,0,0
102,0,0,0
关于csv - 将 CSV 拆分为包含一组唯一字段值的多个文件,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/29261265/