python - Pandas str.replace 跳过一些替换

标签 python python-3.x pandas

我在名为 selected_id_df 的 Pandas 数据框中有一列 ms_sample_id。独特的行由

selected_id_df.ms_sample_id.unique()

产生:

   array(['mitra_baseline_310808-1', 'mitra_baseline_310808-2',
   'mitra_baseline_310808-3', 'mitra_baseline_310808-4',
   'mitra_baseline_310907-1', 'mitra_baseline_310907-2',
   'mitra_baseline_310907-3', 'mitra_baseline_310907-4',
   'mitra_baseline_311090-1', 'mitra_baseline_311090-2',
   'mitra_baseline_311090-3', 'mitra_baseline_311090-4',
   'mitra_baseline_311091-1', 'mitra_baseline_311091-2',
   'mitra_baseline_311091-3', 'mitra_baseline_311091-4',
   'mitra_baseline_311123-1', 'mitra_baseline_311123-2',
   'mitra_baseline_311123-3', 'mitra_baseline_311123-4',
   'frozen-2w_310808-1', 'frozen-2w_310808-2', 'frozen-2w_310907-1',
   'frozen-2w_310907-2', 'frozen-2w_311090-1', 'frozen-2w_311090-2',
   'frozen-2w_311091-1', 'frozen-2w_311091-2', 'frozen-2w_311123-1',
   'frozen-2w_311123-2', 'RT-2w_310808-1', 'RT-2w_310808-2',
   'RT-2w_310907-1', 'RT-2w_310907-2', 'RT-2w_311090-1',
   'RT-2w_311090-2', 'RT-2w_311091-1', 'RT-2w_311091-2',
   'RT-2w_311123-1', 'RT-2w_311123-2', 'LT_RT_310808_1',
   'LT_RT_310808_2', 'LT_RT_310907_1', 'LT_RT_310907_2',
   'LT_RT_311090_1', 'LT_RT_311090_2', 'LT_RT_311091_1',
   'LT_RT_311091_2', 'LT_RT_311123_1', 'LT_RT_311123_2',
   'LT-frozen_310808_1', 'LT-frozen_310808_2', 'LT-frozen_310907_1',
   'LT-frozen_310907_2', 'LT-frozen_311090_1', 'LT-frozen_311090_2',
   'LT-frozen_311091_1', 'LT-frozen_311091_2', 'LT-frozen_311123_1',
   'LT-frozen_311123_2'], dtype=object)

我想用 _ 替换 id 中的一些 -。我这样做如下:

selected_id_df.loc[:,'ms_sample_id'] = (selected_id_df.loc[:,'ms_sample_id'] 
                                   .str.strip()
                                   .str.replace("frozen_2w", 'frozen-2w')
                                   .str.replace("RT_2w", 'RT-2w')
                                   .str.replace('mitra_baseline', 'mitra-baseline')
                                   .str.replace('LT_RT', 'LT-RT')                                      
                                   .str.replace('-1', '_1')
                                   .str.replace('-2', '_2')
                                   .str.replace('-3', '_3')
                                   .str.replace('-4', '_4'))

运行上述语句后,我再次使用

selected_id_df.ms_sample_id.unique()

这一次产生:

array(['mitra-baseline_310808_1', 'mitra-baseline_310808_2',
   'mitra-baseline_310808_3', 'mitra-baseline_310808_4',
   'mitra-baseline_310907_1', 'mitra-baseline_310907_2',
   'mitra-baseline_310907_3', 'mitra-baseline_310907_4',
   'mitra-baseline_311090_1', 'mitra-baseline_311090_2',
   'mitra-baseline_311090_3', 'mitra-baseline_311090_4',
   'mitra-baseline_311091_1', 'mitra-baseline_311091_2',
   'mitra-baseline_311091_3', 'mitra-baseline_311091_4',
   'mitra-baseline_311123_1', 'mitra-baseline_311123_2',
   'mitra-baseline_311123_3', 'mitra-baseline_311123_4',
   'frozen_2w_310808_1', 'frozen_2w_310808_2', 'frozen_2w_310907_1',
   'frozen_2w_310907_2', 'frozen_2w_311090_1', 'frozen_2w_311090_2',
   'frozen_2w_311091_1', 'frozen_2w_311091_2', 'frozen_2w_311123_1',
   'frozen_2w_311123_2', 'RT_2w_310808_1', 'RT_2w_310808_2',
   'RT_2w_310907_1', 'RT_2w_310907_2', 'RT_2w_311090_1',
   'RT_2w_311090_2', 'RT_2w_311091_1', 'RT_2w_311091_2',
   'RT_2w_311123_1', 'RT_2w_311123_2', 'LT-RT_310808_1',
   'LT-RT_310808_2', 'LT-RT_310907_1', 'LT-RT_310907_2',
   'LT-RT_311090_1', 'LT-RT_311090_2', 'LT-RT_311091_1',
   'LT-RT_311091_2', 'LT-RT_311123_1', 'LT-RT_311123_2',
   'LT-frozen_310808_1', 'LT-frozen_310808_2', 'LT-frozen_310907_1',
   'LT-frozen_310907_2', 'LT-frozen_311090_1', 'LT-frozen_311090_2',
   'LT-frozen_311091_1', 'LT-frozen_311091_2', 'LT-frozen_311123_1',
   'LT-frozen_311123_2'], dtype=object)

我们可以看到我的替换语句对我的两个替换项不起作用:

.str.replace("frozen_2w", 'frozen-2w')
.str.replace("RT_2w", 'RT-2w')

我很疑惑,为什么会这样?

谢谢

最佳答案

试试这个正则表达式解决方案:

s.replace('-(?=[0-9])','_', regex=True).replace('_(?=2w|baseline|RT)','-', regex=True)

解释:

  • 我们使用正则表达式在数字 [0-9] 之前找到 - 并替换为 _
  • 我们再次使用正则表达式在2w或baseline或RT之前找到_并替换为-

举例:

import pandas as pd

s = pd.Series(['mitra_baseline_310808-1', 'mitra_baseline_310808-2',
   'mitra_baseline_310808-3', 'mitra_baseline_310808-4',
   'mitra_baseline_310907-1', 'mitra_baseline_310907-2',
   'mitra_baseline_310907-3', 'mitra_baseline_310907-4',
   'mitra_baseline_311090-1', 'mitra_baseline_311090-2',
   'mitra_baseline_311090-3', 'mitra_baseline_311090-4',
   'mitra_baseline_311091-1', 'mitra_baseline_311091-2',
   'mitra_baseline_311091-3', 'mitra_baseline_311091-4',
   'mitra_baseline_311123-1', 'mitra_baseline_311123-2',
   'mitra_baseline_311123-3', 'mitra_baseline_311123-4',
   'frozen_2w_310808-1', 'frozen-2w_310808-2', 'frozen-2w_310907-1',
   'frozen-2w_310907-2', 'frozen-2w_311090-1', 'frozen-2w_311090-2',
   'frozen-2w_311091-1', 'frozen-2w_311091-2', 'frozen-2w_311123-1',
   'frozen-2w_311123-2', 'RT-2w_310808-1', 'RT-2w_310808-2',
   'RT-2w_310907-1', 'RT-2w_310907-2', 'RT-2w_311090-1',
   'RT-2w_311090-2', 'RT-2w_311091-1', 'RT-2w_311091-2',
   'RT-2w_311123-1', 'RT-2w_311123-2', 'LT_RT_310808_1',
   'LT_RT_310808_2', 'LT_RT_310907_1', 'LT_RT_310907_2',
   'LT_RT_311090_1', 'LT_RT_311090_2', 'LT_RT_311091_1',
   'LT_RT_311091_2', 'LT_RT_311123_1', 'LT_RT_311123_2',
   'LT-frozen_310808_1', 'LT-frozen_310808_2', 'LT-frozen_310907_1',
   'LT-frozen_310907_2', 'LT-frozen_311090_1', 'LT-frozen_311090_2',
   'LT-frozen_311091_1', 'LT-frozen_311091_2', 'LT-frozen_311123_1',
   'LT-frozen_311123_2'])

print(s.replace('-(?=[0-9])','_', regex=True).replace('_(?=2w|baseline|RT)','-', regex=True))

关于python - Pandas str.replace 跳过一些替换,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/50009504/

相关文章:

python - 如何生成密码文件来破解zip文件?

python - python中的xml遍历

python - Pandas groupby 获取月份和年份值

python - 在Azure ML上开始训练模型

python - 是否可以使用 Kotlin 制作 Jython 模块?

python - Pandas 错误 - 将多个文件 append 到一个文件中

python - 使用多级列有条件地更改 Pandas DF 中的值

python-3.x - pd.to_gbq() 从 pandas 加载到 bigquery() 是否有限制?

python - 后面只有数字的正则表达式

python - 在不更改源代码的情况下在 stdout 上显示 INFO 级别的 python 日志