python - 检查字符串列表是否被准确找到 n 次

标签 python string

我正在努力综合几个我一直在阅读的答案,这些答案接近我想要做的事情,而且我无法制定一些谷歌-fu来为我提供任何现有的答案!我知道这很简单,但我现在不知所措。

this question 非常相似,我想找到已读入另一个文件中出现的元组的几个字符串,但是,我只想要每个字符串匹配仅一次的行。因此,据我所知,anyall 不符合要求。

到目前为止,我所得到的已经很接近了,line.count 给了我每行出现的次数,但它有两种错误:

首先,对于给定的行,line.count 不知何故小于 1?

我知道我在迭代/搜索每个键和/或使用 == 1 测试的方式上做错了,但我无法弄清楚。

我正在寻找的字符串元组是:

['AG49', 'AG51', 'AGBD', 'AGHT', 'AGJN', 'AGKC', 'AGNP', 'AGTI', 'LG01', 'LG33', 'LG45']

要搜索的文件的一些示例行是(它们将包含 2 到数十个条目(下面的 OG_1000 实际上是最长的行/最多的成员):

OG_1000: AG49|00461 AG49|03016 AG49|03395 AG49|01465 AG49|01485 AG49|02179 AG49|02513 AG49|03071 AG49|03396 AG49|02649 AG51|00302 AG51|00779 AG51|01746 AG51|02077 AG51|02502 AG51|01654 AG51|01963 AG51|01965 AGBD|01544 AGBD|02407 AGBD|02722 AGBD|03152 AGBD|02292 AGBD|03607 AGBD|03608 AGBD|03609 AGHT|00130 AGHT|00873 AGHT|00911 AGHT|01291 AGHT|02476 AGHT|02881 AGHT|02477 AGHT|02973 AGHT|02974 AGHT|02975 AGJN|00381 AGJN|00633 AGJN|01876 AGJN|02007 AGJN|02058 AGJN|02059 AGJN|02060 AGJN|02398 AGJN|02399 AGJN|02433 AGJN|02418 AGKC|00658 AGKC|00659 AGKC|00660 AGKC|01985 AGKC|02826 AGKC|02881 AGKC|01323 AGKC|01327 AGKC|01324 AGKC|02267 AGKC|02827 AGKC|02880 AGKC|04269 AGKC|02428 AGNP|00290 AGNP|02833 AGNP|03160 AGNP|03601 AGNP|03987 AGNP|03988 AGNP|03989 AGNP|04108 AGTI|00388 AGTI|01459 AGTI|03163 AGTI|03688 AGTI|00570 AGTI|04026 AGTI|03715 AGTI|03716 AGTI|03717 LG01|00908 LG01|00909 LG01|00910 LG01|01116 LG01|03323 LG01|03588 LG01|03589 LG01|03590 LG01|03591 LG01|01118 LG01|01908 LG01|03182 LG01|03189 LG01|01906 LG33|01192 LG33|01786 LG33|01787 LG33|01973 LG33|03700 LG33|04518 LG33|04759 LG33|01756 LG33|01760 LG33|01971 LG33|02055 LG33|02056 LG33|02057 LG45|00001 LG45|01508 LG45|01643 LG45|00233 LG45|00786 LG45|01599 LG45|01600 LG45|01601 LG45|04210 LG45|04212 LG45|04213 LG45|04637 LG45|03265 LG45|04211 LG45|03255 LG45|03261 AG51|00629 AGKC|04214 AG49|02651 AGBD|01546 AGKC|02430 AGNP|02835 AGTI|01461 LG45|00784 LG33|04104 LG45|00192 LG45|00193 LG33|00381 LG33|01750
OG_1082: AG49|00880 AG49|02960 AG51|02815 AG51|04137 AGNP|00113 AGNP|03735 AGTI|00006 AGTI|02047 AGBD|01827 AGHT|00357 AGJN|03158 AGKC|02788 LG01|01472 LG33|02682 LG45|01009
OG_7229: LG33|04676 LG45|01800

有效行的示例是:

OG_1264: AG49|00061 AG51|03472 AGBD|01583 AGHT|03015 AGJN|02348 AGKC|00003 AGNP|02702 AGTI|02067 LG01|00073 LG33|02222 LG45|04062

每个字符串仅出现一次。

我现在的代码(减去一些选项解析等):

# Get a tuple of strings to iterate over
def getKeys(nameFile):
    with open(nameFile, "r") as namehandle:
        names = []
            for line in namehandle:
                strip = line.rstrip('\n')
            names.append(strip)

    return names

# Main code:
keys = getKeys(nameFile)

matchedLines = []

with open(args.infile, "r") as clusterFile:
    for line in clusterFile:
        for key in keys:
            if line.count(key) == 1:
                matchedLines.append(line)

最佳答案

在您的代码中,matchedLines 将多次出现同一行,但它仍然不会为您提供与所有键一次匹配的行。为此,您仍然可以使用 all:

with open(args.infile, "r") as clusterFile:
    matchedLines = [line for line in clusterFile if all([line.count(key) == 1 for key in keys])]

关于python - 检查字符串列表是否被准确找到 n 次,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/40486209/

相关文章:

python - 无法使用python将JSON文件从谷歌云存储加载到bigquery

python - 遍历属性列表

c# - 如何用空字符串替换出现的 "-"?

java - 取多个拆分字符串的第一个大写字符

python - 删除字符串python中的空格和破折号

python - 静态方法语法困惑

python - CSS 定位器 : unable to locate element via code

python - 如何追加到 Django 模型中的现有字段?

c - 需要对名称链接列表进行合并排序

java - NSData 到 Java 字符串