【发布时间】:2014-06-24 23:40:42
【问题描述】:
有没有使用python大量下载大量文件的好方法?这段代码的速度足以下载大约 100 个左右的文件。但我需要下载 300,000 个文件。显然它们都是非常小的文件(或者我不会下载 300,000 个 :))所以真正的瓶颈似乎是这个循环。有人有想法吗?也许使用 MPI 或线程?
我只能忍受瓶颈吗?或者有没有更快的方法,甚至可能不使用python?
(为了完整起见,我包含了代码的完整开头)
from __future__ import division
import pandas as pd
import numpy as np
import urllib2
import os
import linecache
#we start with a huge file of urls
data= pd.read_csv("edgar.csv")
datatemp2=data[data['form'].str.contains("14A")]
datatemp3=data[data['form'].str.contains("14C")]
#data2 is the cut-down file
data2=datatemp2.append(datatemp3)
flist=np.array(data2['filename'])
print len(flist)
print flist
###below we have a script to download all of the files in the data2 database
###here you will need to create a new directory named edgar14A14C in your CWD
original=os.getcwd().copy()
os.chdir(str(os.getcwd())+str('/edgar14A14C'))
for i in xrange(len(flist)):
url = "ftp://ftp.sec.gov/"+str(flist[i])
file_name = str(url.split('/')[-1])
u = urllib2.urlopen(url)
f = open(file_name, 'wb')
f.write(u.read())
f.close()
print i
【问题讨论】:
-
multiprocessing将允许您从其他内核中获得一些加速(您需要将较大的列表拆分为 X 个较小的列表,并将一个列表分配给每个内核) -
您对服务器有任何控制权吗?您能否在需要时使服务器压缩并发送有问题的文件?
-
@dawg:我不这样做,否则在飞行中抓住它们可能是最好的解决方案。