python - 如何求连续减少(增加)的次数

标签 python pandas numpy dataframe

如何查找连续减少(增加)的次数

我有一个数据框,其中包含月份的 500K 行和 12 列,包括开始月和结束月。每列代表一个月。我需要比较范围(startMonth、endmonth)内的每一行、第 i 个月和第 (i+1) 个月。 (PS:范围不是恒定的。每行都有不同的范围大小。)

条件:如果开始月份 > 结束月份,我应该看到“Neg99 = -999”

这是我的示例数据:

import pandas as pd
import numpy as np

idx = [1001,1002,1003,1004,1005,1006,1007,1008,1009,1010,1011,1012,1013,1014,1015,1016,1017,1018]
data = {'M_1': [3, 1, 0, 0, 1, 0, 1, 1, 1, 0, 6, 6, 6,0,0,2,0,2],
        'M_2': [2, 2, 3, 1, 1, 0, 1, 2, 0, 1, 5, 5, 5,1,1,1,1,2],
        'M_3': [1, 3, 2, 2, 1, 0, 1, 2, 1, 0, 4, 4, 4,1,1,0,2,2],
        'M_4': [0, 4, 1, 3, 1, 0, 1, 2, 0, 1, 3, 0, 3,1,1,0,0,0],
        'M_5': [1, 0, 0, 4, 2, 0, 1, 3, 1, 0, 2, 1, 2,1,1,0,0,0],
        'M_6': [2, 0, 0, 0, 3, 0, 1, 3, 0, 1, 1, 2, 1,1,1,0,0,0],
        'M_7': [3, 0, 0, 0, 2, 0, 1, 2, 1, 0, 0, 3, 0,0,1,0,0,0],
        'M_8': [0, 1, 0, 0, 2, 0, 1, 2, 0, 1, 1, 1, 1,0,0,0,0,0],
        'M_9': [0, 2, 0, 0, 1, 0, 1, 2, 1, 0, 0, 0, 0,0,0,0,0,0],
        'M_10': [0, 3, 0, 0, 1, 0, 1, 0, 0, 1, 0, 0, 0,0,0,0,0,0],
        'M_11': [0, 0, 0, 0, 0, 0, 1, 0, 1, 0, 0, 0, 0,0,0,0,0,0],
        'M_12': [0, 0, 0, 0, 0, 0, 1, 0, 0, 1, 0, 0, 0,0,0,0,0,0]}



startMonth = pd.DataFrame([1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 4, 4, 5,1,1,1,1,1],
                          columns=['start'],index=idx)
endMonth = pd.DataFrame([12, 12, 12, 12, 12, 12, 12, 12, 12, 12, 12, 12, 2,12,12,2,2,2],
                        columns=['end'], index=idx)

df1 = pd.DataFrame(data, index=idx)
Neg99 = -999

我为日期范围编写了 bool 数组;

arr_bool = (np.less_equal.outer(startMonth.start, range(1,13)) 
            & np.greater_equal.outer(endMonth.end, range(1,13))
            )

masked=df1.filter(regex='M_[0-9]').mask(~arr_bool)

我需要找到每一行的连续减少和增加。

  • 这是减少代码;
# Consecutive Decreases
decr = (np.diff(np.hstack((masked.values, np.zeros((masked.values.shape[0], 1)))), axis=1) > 0).argmin(axis=1)

final_decr = pd.DataFrame(decr,
                      index=idx, columns=['decr'])


final_decr.decr= np.select( condlist = [startMonth.start > endMonth.end],
                           choicelist = [Neg99],
                           default = final_decr.decr)
  • 这里是增加代码;
incr = (np.diff(np.hstack((masked.values, np.zeros((masked.values.shape[0], 1)))), axis=1) < 0).argmin(axis=1)

final_incr = pd.DataFrame(incr,
                      index=idx, columns=['incr'])
final_incr.incr= np.select( condlist = [startMonth.start > endMonth.end],
                           choicelist = [Neg99],
                           default = final_incr.incr)

最后,我的预期输出是;

Final increase table (.csv);
idx,my_results,expected_result
1001,0,0
1002,3,3
1003,1,1
1004,4,4
1005,0,0
1006,0,0
1007,0,0
1008,1,1
1009,0,0
1010,1,1
1011,0,3
1012,0,0
1013,-999,-999
1014,5,1
1015,6,1
1016,0,0
1017,0,2
1018,0,0

Final decrease table (.csv);
idx,my_result,expected_result
1001,3,3
1002,0,0
1003,0,0
1004,0,0
1005,0,0
1006,0,0
1007,0,0
1008,0,0
1009,1,1
1010,0,0
1011,0,0
1012,0,3
1013,-999,-999
1014,0,0
1015,0,0
1016,0,2
1017,0,0
1018,0,0

Final NoChange table (.csv);
idx,my_result,expected_result
1001,0,0
1002,0,0
1003,0,0
1004,0,0
1005,3,3
1006,11,11
1007,11,11
1008,0,0
1009,0,0
1010,0,0
1011,0,0
1012,0,0
1013,-999,-999
1014,0,0
1015,0,0
1016,0,0
1017,0,0
1018,2,0

Thanks for your advice!

最佳答案

所以我认为您可以使用idxmin而不是使用argmin重命名列以获取位置的整数值后。然后删除 startMonth 的值,例如:

incr = (df1.rename(columns={col:int(col.split('_')[1]) for col in masked.columns})
           .diff(-1, axis=1) < 0).mask(~arr_bool).idxmin(axis=1) - startMonth.start
decr = (df1.rename(columns={col:int(col.split('_')[1]) for col in masked.columns})
           .diff(-1, axis=1) > 0).mask(~arr_bool).idxmin(axis=1) - startMonth.start

然后你可以像你一样执行np.select,或者可能只是一个.illna(-999)就足够了,因为我认为这个解决方案无处不在结果中包含 nan 将满足您的条件 startMonth.start > endMonth.end

关于python - 如何求连续减少(增加)的次数,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/56397021/

相关文章:

Python在没有-inf的情况下获取最小值

python lxml 添加未使用的命名空间

python - Numpy 和 PyTables 的浮点异常

python - 使用 DRF 按 ID 过滤的一般方法

python - 在 Sklearn 中为 excel 输出着色

python - 处理从 pandas.df.loc 到空选择的分配

python - 什么是存储和处理 200,000 多个时间序列的良好数据结构和工具?

python - Numpy 和 Scipy 在 Windows 上的安装

python - 在 numpy 中用 2d 掩码屏蔽 3d 数组

python - 使用较低暗淡的索引数组索引 numpy 数组会产生比两者都更高暗淡的数组