csv - 将 CSV 拆分为包含一组唯一字段值的多个文件

作为 awk 的初学者，我能够通过

分割具有唯一值的数据

awk -F, '{print >> $1".csv";close($1)}' myfile.csv

但我想根据附加条件(即特定列中唯一值的出现)拆分大型 CSV 文件。

具体来说，有输入

111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0

我希望输出文件是

111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1

和

444,1,1,1
444,1,0,1
555,1,1,1
666,1,0,0

每个都包含三个(在本例中)第一列中的唯一值，分别为111,222,333和444,555,666。任何帮助将不胜感激。

最佳答案

这就能解决问题，我发现它非常可读且易于理解:

awk -F',' 'BEGIN { count=0; filename=1 }
            x[$1]++==0 {count++}
            count==4 { count=1; filename++}
            {print >> filename".csv"; close(filename".csv");}' file

我们从计数 0 开始，文件名从 1 开始。然后，我们对从第一列获得的每个唯一值进行计数，每当出现第四个值时，我们就会重置计数并移至下一个文件名。

这是我使用的一些示例数据，这只是您的数据，还有一些附加行。

~$ cat test.txt
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0
777,1,1,1
777,1,0,1
777,1,1,0
777,1,1,1
888,1,0,1
888,1,1,1
999,1,1,1
999,0,0,0
999,0,0,1
101,0,0,0
102,0,0,0

像这样运行 awk:

~$ awk -F',' 'BEGIN { count=0; filename=1 }
            x[$1]++==0 {count++}
            count==4 { count=1; filename++}
            {print >> filename".csv"; close(filename".csv");}' test.txt

我们看到以下输出文件和内容:

~$ cat 1.csv
111,1,0,1
111,1,1,1
222,1,1,1
333,1,0,0
333,1,1,1

~$ cat 2.csv
444,1,1,1
444,0,0,0
555,1,1,1
666,1,0,0

~$ cat 3.csv
777,1,1,1
777,1,0,1
777,1,1,0
777,1,1,1
888,1,0,1
888,1,1,1
999,1,1,1
999,0,0,0
999,0,0,1

~$ cat 4.csv
101,0,0,0
102,0,0,0

关于csv - 将 CSV 拆分为包含一组唯一字段值的多个文件，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/29261265/

csv - 将 CSV 拆分为包含一组唯一字段值的多个文件

上一篇：arrays - 大型数组中的几何着色器错误

下一篇：.net - StackTrace 中的托管/ native 转换在哪里？