【发布时间】:2014-07-07 14:35:05
【问题描述】:
我正在编写一个创建多个 URL 的代码,这些 URL 又存储在一个列表中。 下一步是,打开每个 URL,下载数据(只是文本,格式为 XML 或 JSON)并保存下载的数据。
感谢这里的在线社区,我的代码运行良好。它停留在打开 URL 并下载数据的地方。我希望 url.request 使用我创建的 url 遍历列表并分别调用每个 url,打开它,显示它并继续下一个。但它只执行循环来创建 url,但什么也没有。没有反馈,什么都没有。
import urllib.request
.... some calculations for llong and llat ....
#create the URLs and store in list
urls = []
for lat,long,lat1,long1 in (zip(llat, llong,llat[1:],llong[1:])):
for pages in range (1,17):
print ("https://api.flickr.com/services/rest/?method=flickr.photos.search&format=json&api_key=5.b&nojsoncallback=1&page={}&per_page=250&bbox={},{},{},{}&accuracy=1&has_geo=1&extras=geo,tags,views,description".format(pages,long,lat,long1,lat1))
print (urls)
#accessing the website
data = []
for amounts in urls:
response = urllib.request.urlopen(urls)
flickrapi = data.read()
data.append(+flickrapi)
data.close()
print (data)
我做错了什么?
下一步是下载数据并将其保存到文件或其他位置以供进一步处理。 由于我将收到大量数据,就像很多很多一样,我不确定存储它以使用 R(或者可能是 Python?- 需要对其进行一些统计工作)对其进行处理的最佳方法是什么。有什么建议吗?
【问题讨论】:
标签: python url screen-scraping bigdata urllib