【发布时间】:2016-06-18 18:37:15
【问题描述】:
我正在尝试制作一个爬虫,它可以进入网页并下载该页面上所有可用的图像。我的代码是这样的
import random
import urllib.request
import requests
from bs4 import BeautifulSoup
def get_images(url):
code = requests.get(url)
text = code.text
soup = BeautifulSoup(text)
for img in soup.findAll('img'):
src = img.get('src')
download_image(src)
def download_image(url):
name = random.randrange(1, 100)
image_name = str(name) + ".jpg"
urllib.request.urlretrieve(url, image_name)
get_images("http://www.any_url.com/")
现在很多图片的src 标签中通常不包含完整的网址。现在,我的问题是如何获取图片的完整 URL 以便我可以下载它们?
【问题讨论】:
标签: python beautifulsoup web-crawler