【发布时间】:2017-05-02 13:17:39
【问题描述】:
我制作了一个从网站下载图像的刮板。但是,当我运行它时,它会抛出错误显示:[raise HTTPError(req.full_url, code, msg, hdrs, fp) urllib.error.HTTPError:HTTP 错误 403]。我也在其他网站上使用这种方法来抓取图像,但没有遇到任何问题。我无法弄清楚为什么会出现此错误以及解决方法是什么。希望有人调查一下。
import requests
import urllib.request
from lxml import html
def PictureScraping():
url = "https://www.yify-torrent.org/search/1080p/"
response = requests.get(url)
tree = html.fromstring(response.text)
titles = tree.xpath('//div[@class="movie-image"]')
for title in titles:
Pics = "https:" + title.xpath('.//img/@src')[0]
urllib.request.urlretrieve(Pics, Pics.split('/')[-1])
PictureScraping()
【问题讨论】:
-
它是
403HTTP 代码,又名未授权。您肯定会被发现为爬虫,因此被列入黑名单。您必须使用代理和用户代理 http 标头来绕过这种行为
标签: python web-crawler