【发布时间】:2018-08-03 15:48:43
【问题描述】:
我正在使用 335 个 URL 的列表,每个 URL 由不同的基因访问号组成,以向 NCBI 网站 GenBank 发出请求。我想要的部分数据在一个名为:
//*[@id="viewercontent1"]/pre
我似乎无法调出我需要什么选择器工具来获取它,我需要 GenBank 上每个 XML 页面的一小段文本。
我的代码是:
import csv
result = []
for line in open("C:/Projects/NCBI Scraper project/geneAccNumbers.txt"):
result.append(line.split(','))
csv = open("C:/Projects/NCBI Scraper project/geneAccNumbers.txt", 'r')
for gene in csv.readline().split(','):
URL = URL = 'https://www.ncbi.nlm.nih.gov/nuccore/' + gene + '.1?report=fasta'
def build_url(gene):
return 'https://www.ncbi.nlm.nih.gov/nuccore/' + gene + '.1?report=fasta'
genes_urls = [build_url(gene) for gene in csv]
import pip
import requests
res = []
for url in genes_urls:
res.append(requests.get(url))
import scrapy
hxs.select('//*[@id="viewercontent1"]/pre').extract()
除了最后一行之外,一切都运行了。我还需要知道如何拆分和组织我想要的所有抓取的文本数据。
这是我要抓取的信息的网站示例:
https://www.ncbi.nlm.nih.gov/nuccore/DQ147858.1?report=fasta
非常感谢任何帮助。
【问题讨论】:
标签: python html xml scrapy python-requests