【发布时间】:2019-12-04 12:55:26
【问题描述】:
我的目标是自动化谷歌反向图片搜索。
我想上传一个图片 url 并获取所有包含匹配图片的网站链接。
所以这是我目前为止可以制作的:
import requests
import bs4
# Let's take a picture of Chicago
chicago = 'https://images.squarespace-cdn.com/content/v1/556e10f5e4b02ae09b8ce47d/1531155504475-KYOOS7EEGVDGMMUQQNX3/ke17ZwdGBToddI8pDm48kCf3-plT4th5YDY7kKLGSZN7gQa3H78H3Y0txjaiv_0fDoOvxcdMmMKkDsyUqMSsMWxHk725yiiHCCLfrh8O1z4YTzHvnKhyp6Da-NYroOW3ZGjoBKy3azqku80C789l0h8vX1l9k24HMAg-S2AFienIXE1YmmWqgE2PN2vVFAwNPldIHIfeNh3oAGoMooVv2g/Chi+edit-24.jpg'
# And let's take google image search uploader by url
googleimage = 'https://www.google.com/searchbyimage?&image_url='
# Here is our Chicago image url uploaded into google image search
url = googleimage+chicago
# And now let's request our Chichago google image search
response = requests.get(url)
soup = bs4.BeautifulSoup(response.text,'html.parser')
# Here is the output
print(soup.prettify())
我的问题是我没想到这个print(soup.prettify())output。
我没有在帖子中包含输出,因为它太长了。
如果您在浏览器中输入:
https://www.google.com/searchbyimage?&image_url=https://images.squarespace-cdn.com/content/v1/556e10f5e4b02ae09b8ce47d/1531155504475-KYOOS7EEGVDGMMUQQNX3/ke17ZwdGBToddI8pDm48kCf3-plT4th5YDY7kKLGSZN7gQa3H78H3Y0txjaiv_0fDoOvxcdMmMKkDsyUqMSsMWxHk725yiiHCCLfrh8O1z4YTzHvnKhyp6Da-NYroOW3ZGjoBKy3azqku80C789l0h8vX1l9k24HMAg-S2AFienIXE1YmmWqgE2PN2vVFAwNPldIHIfeNh3oAGoMooVv2g/Chi+edit-24.jpg
您会看到 html 代码与我们的输出有很大不同,soup。
我期待soup 代码有最终结果,这样我就可以解析我需要的链接。相反,我只得到了一些我不太了解的奇怪功能。
似乎谷歌图片搜索是一个三步过程:首先你上传你的图片,然后发生一些奇怪的功能,然后你得到你的最终结果。
我如何才能像在浏览器中一样获得最终结果?这样我就可以像往常一样解析html代码了。
【问题讨论】:
标签: python web-scraping google-image-search