假设我有一个包含重复列的数据框 my_df
,例如
foo bar foo hello
0 1 1 5
1 1 2 5
2 1 3 5
我想创建另一个平均重复数据的数据框:
foo bar hello
0.5 1 5
1.5 1 5
2.5 1 5
我如何在 Pandas 中执行此操作?
到目前为止,我已经设法识别出重复项:
my_columns = my_df.columns
my_duplicates = print [x for x, y in collections.Counter(my_columns).items() if y > 1]
我不知道如何让 Pandas 对它们进行平均。
最佳答案
In [11]: df.groupby(level=0, axis=1).mean()
Out[11]:
bar foo hello
0 1 0.5 5
1 1 1.5 5
2 1 2.5 5
一个有点棘手的例子是如果有一个非数字列:
In [21]: df
Out[21]:
foo bar foo hello
0 0 1 1 a
1 1 1 2 a
2 2 1 3 a
以上将引发:DataError: No numeric types to aggregate
。绝对不会赢得任何奖励效率,但这里是在这种情况下的通用方法:
In [22]: dupes = df.columns.get_duplicates()
In [23]: dupes
Out[23]: ['foo']
In [24]: pd.DataFrame({d: df[d] for d in df.columns if d not in dupes})
Out[24]:
bar hello
0 1 a
1 1 a
2 1 a
In [25]: pd.concat(df.xs(d, axis=1) for d in dupes).groupby(level=0, axis=1).mean()
Out[25]:
foo
0 0.5
1 1.5
2 2.5
In [26]: pd.concat([Out[24], Out[25]], axis=1)
Out[26]:
foo bar hello
0 0.5 1 a
1 1.5 1 a
2 2.5 1 a
我认为要避免的是避免列重复...或者我不知道自己在做什么。
关于python - Pandas :创建新的数据框,平均来自另一个数据框的重复项,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/16678551/