python,通过坐标从DAS获取序列

标签 python xml parsing sequence

ucsc DAS server ,通过坐标获取 DNA 序列。

网址:http://genome.ucsc.edu/cgi-bin/das/hg19/dna?segment=chr20:30037432,30038060

示例文件:

<DASDNA>
  <SEQUENCE id="chr20" start="30037832" stop="30038060" version="1.00">
  <DNA length="229">
    gtggcacccaaagatgctggaatctttatggcaaatgccgttacagatgc            
    tccaagaaggaaagagtctatgtttactgcataaataataaaatgtgctg     
    cgtgaagcccaagtaccagccaaaagaaaggtggtggccattttaactgc 
    tttgaagcctgaagccatgaaaatgcagatgaagctcccagtggattccc 
    acactctatcaataaacacctctggctga
  </DNA>
  </SEQUENCE>
</DASDNA>

我想要的是这部分:

    gtggcacccaaagatgctggaatctttatggcaaatgccgttacagatgc            
    tccaagaaggaaagagtctatgtttactgcataaataataaaatgtgctg     
    cgtgaagcccaagtaccagccaaaagaaaggtggtggccattttaactgc 
    tttgaagcctgaagccatgaaaatgcagatgaagctcccagtggattccc 
    acactctatcaataaacacctctggctga

我想从数千个此类网址中获取序列部分,我该怎么做? 我尝试将数据写入文件并解析文件,它工作正常,但是有没有办法直接解析类似xml的字符串?我尝试了其他帖子中的一些示例,但它们不起作用。

在这里,我添加了我的解决方案。感谢以下 2 个答案。

解决方案 1:

def getSequence2(chromosome, start, end):
    base = 'http://genome.ucsc.edu/cgi-bin/das/hg19/dna?segment='
    url = base + chromosome + ':' + str(start) + ',' + str(end)
    doc = etree.parse(url,parser=etree.XMLParser())
    if doc != '':
        sequence = doc.xpath('SEQUENCE/DNA/text()')[0].replace('\n','')
    else:
        sequence = 'THE SEQUENCE DOES NOT EXIST FOR GIVEN COORDINATES'
    return sequence

解决方案 2:

def getSequence1(chromosome, start, end):
    base = 'http://genome.ucsc.edu/cgi-bin/das/hg19/dna?segment='
    url = base + chromosome + ':' + str(start) + ',' + str(end)
    xml = urllib2.urlopen(url).read()
    if xml != '':
        w = open('temp.xml', 'w')
        w.write(xml)
        w.close()
        dom = parse('temp.xml')
        data = dom.getElementsByTagName('DNA')
        sequence = data[0].firstChild.nodeValue.replace('\n','')
    else: 
        sequence = 'THE SEQUENCE DOES NOT EXIST FOR GIVEN COORDINATES'
    return sequence

当然他们需要导入一些必要的库。

最佳答案

>>> from lxml import etree
>>> doc = etree.parse("http://genome.ucsc.edu/cgi-bin/das/hg19/dna?segment=chr20:30037432,30038060",parser=etree.XMLParser())
>>> doc.xpath('SEQUENCE/DNA/text()')
['\natagtggcacatgtctgttgtcctagctcctcggggaaactcaggtggga\ngagtcccttgaactgggaggaggaggtttgcagtgagccagaatcattcc\nactgtactccagcctaggtgacagagcaagactcatctcaaaaaaaaaaa\naaaaaaaaaaaaaagacaatccgcacacataaaggctttattcagctgat\ngtaccaaggtcactctctcagtcaaaggtgggaagcaaaaaaacagagta\naaggaaaaacagtgatagatgaaaagagtcaaaggcaagggaaacaaggg\naccttctatctcatctgtttccattcttttacagacctttcaaatccgga\ngcctacttgttaggactgatactgtctcccttctttctgctttgtgtcag\ngtggcacccaaagatgctggaatctttatggcaaatgccgttacagatgc\ntccaagaaggaaagagtctatgtttactgcataaataataaaatgtgctg\ncgtgaagcccaagtaccagccaaaagaaaggtggtggccattttaactgc\ntttgaagcctgaagccatgaaaatgcagatgaagctcccagtggattccc\nacactctatcaataaacacctctggctga\n']

关于python,通过坐标从DAS获取序列,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/22328319/

相关文章:

python - Fabric 任务的返回值

python - 如何将表导出到以字段值作为文件名而不是部分的文件中

python - numpy中不同形状数组之间的乘法

xml - 无法使用 XSLT 文件设置 Amazon AWS 生成的 XML 文件的样式

c# - 从框括号内的字符串中提取子字符串

javascript - 无法使用 Django 设置 jquery pjax(未设置 header ,但添加了 GET 参数)

java - persistence.xml 事务类型 ="JTA"

xml - 扩展站点地图

javascript - 使用纯 Javascript 读取并打印类的 CSS 值

java android 将资源文件路径传递给方法参数