【发布时间】:2015-10-05 06:47:44
【问题描述】:
我正在尝试提取此网站“https://www.ncbi.nlm.nih.gov/nucleotide/209750423?report=genbank#”上的数据。当我使用 urllib 提取内容时,我可以在右键单击浏览器后通过选择“查看页面源”来提取我得到的数据,但我想要的是实际序列 'atggctgaga tgaaaaaacct gaaaattgag gtggtgcgct ataacccgga... .' 可以通过右键单击浏览器并选择“检查元素”而不是通过“查看页面源”来提取。
我使用的代码是
f = open('out.html', 'w')
response = urllib.urlopen("https://www.ncbi.nlm.nih.gov/nucleotide/209750423?report=genbank")
f.write(response.read())
f.close()
【问题讨论】: