【问题标题】:Downloading a LOT of files using python使用python下载大量文件
【发布时间】:2014-06-24 23:40:42
【问题描述】:

有没有使用python大量下载大量文件的好方法?这段代码的速度足以下载大约 100 个左右的文件。但我需要下载 300,000 个文件。显然它们都是非常小的文件(或者我不会下载 300,000 个 :))所以真正的瓶颈似乎是这个循环。有人有想法吗?也许使用 MPI 或线程?

我只能忍受瓶颈吗?或者有没有更快的方法,甚至可能不使用python?

(为了完整起见,我包含了代码的完整开头)

from __future__ import division
import pandas as pd
import numpy as np
import urllib2
import os
import linecache 

#we start with a huge file of urls

data= pd.read_csv("edgar.csv")
datatemp2=data[data['form'].str.contains("14A")]
datatemp3=data[data['form'].str.contains("14C")]

#data2 is the cut-down file

data2=datatemp2.append(datatemp3)
flist=np.array(data2['filename'])
print len(flist)
print flist

###below we have a script to download all of the files in the data2 database
###here you will need to create a new directory named edgar14A14C in your CWD

original=os.getcwd().copy()
os.chdir(str(os.getcwd())+str('/edgar14A14C'))


for i in xrange(len(flist)):
    url = "ftp://ftp.sec.gov/"+str(flist[i])
    file_name = str(url.split('/')[-1])
    u = urllib2.urlopen(url)
    f = open(file_name, 'wb')
    f.write(u.read())
    f.close()
    print i

【问题讨论】:

  • multiprocessing 将允许您从其他内核中获得一些加速(您需要将较大的列表拆分为 X 个较小的列表,并将一个列表分配给每个内核)
  • 您对服务器有任何控制权吗?您能否在需要时使服务器压缩并发送有问题的文件?
  • @dawg:我不这样做,否则在飞行中抓住它们可能是最好的解决方案。

标签: python download urllib2


【解决方案1】:

multiprocessing 的常用模式是创建一个 job() 函数,该函数接受参数并执行一些可能受 CPU 限制的工作。

示例:基于您的代码

from multiprocessing import Pool

def job(url):
    file_name = str(url.split('/')[-1])
    u = urllib2.urlopen(url)
    f = open(file_name, 'wb')
    f.write(u.read())
    f.close()

pool = Pool()
urls = ["ftp://ftp.sec.gov/{0:s}".format(f) for f in flist]
pool.map(job, urls)

这会做很多事情:

  • 根据您的 CPU 或 CPU 核心创建一个多处理池和一组工作线程
  • 创建job() 函数的输入列表。
  • 将输入列表 urls 映射到 job() 并等待所有作业完成。

Python 的 multiprocessing.Pool.map 将负责将您的输入拆分为 no。池中的工人数。

我为这类工作所做的另一件有用的小事是像这样使用progress

from multiprocessing import Pool


from progress.bar import Bar


def job(input):
    # do some work


pool = Pool()
inputs = range(100)
bar = Bar('Processing', max=len(inputs))
for i in pool.imap(job, inputs):
    bar.next()
bar.finish()

当您的工作正在进行时,这会在您的控制台上为您提供一个很好的进度条,以便您对进度和 eta 等有一些了解。

我还发现 requests 库在这里非常有用,并且有一组更好的 API 用于处理网络资源和下载内容。

【讨论】:

  • 是的,这看起来正是我想要的。谢谢你。我会试一试,然后返回并报告。顺便说一句,有没有办法指定我想为池指定多少个核心?我在某种超级计算机上运行它,我不知道占用所有内核是否是一种好的形式:)
  • 我尝试在没有栏的情况下运行上面的代码,但它会引发错误。 : urllib2.URLError: 有什么想法吗? urllib2 好像打不开文件。
  • 为了后代回答我自己的问题,我将 pool = Pool() 更改为 pool = Pool(processes=4) 作为测试,现在我没有收到 URL 错误,但我现在得到了酸洗错误。 PicklingError: Can't pickle : 属性查找 builtin.function failed
  • 所以我发现它正在工作但不完全。每个错误消息仅针对特定进程抛出。因此,如果我想下载 100 个文件,98 会下载,但 2 不会因为错误而下载。我认为这需要进一步调查,但超出了我最初问题的范围,所以我会接受这个答案。谢谢。
猜你喜欢
  • 2018-10-04
  • 1970-01-01
  • 1970-01-01
  • 2014-10-01
  • 2012-01-09
  • 1970-01-01
  • 1970-01-01
  • 2013-08-19
  • 2013-05-17
相关资源
最近更新 更多