【发布时间】:2017-06-06 11:16:23
【问题描述】:
我需要创建一个代码来从一张图片中提取一个单词。 我将解释,从页面 sitemap.xml 中,我的代码必须尝试在此 xml 文件中存在的每个链接中,如果在图像链接中存在特定单词,则在每个链接中找到。
站点地图是 adidas = http://www.adidas.it/on/demandware.static/-/Sites-adidas-IT-Library/it_IT/v/sitemap/product/adidas-IT-it-it-product.xml
这是我为搜索图像创建的代码,其中包含“ZOOM”一词:
import requests
from bs4 import BeautifulSoup
html = requests.get(
'http://www.adidas.it/scarpe-superstar/C77124.html').text
bs = BeautifulSoup(html)
possible_links = bs.find_all('img')
for link in possible_links:
if link.has_attr('src'):
if link.has_key('src'):
if 'zoom' in link['src']:
print link['src']
但是我搜索了一个方法来自动抓取一个列表
非常感谢
我尝试这样做以获得列表:
from bs4 import BeautifulSoup
import requests
url = "http://www.adidas.it/on/demandware.static/-/Sites-adidas-IT-Library/it_IT/v/sitemap/product/adidas-IT-it-it-product.xml"
r = requests.get(url)
data = r.text
soup = BeautifulSoup(data)
for url in soup.findAll("loc"):
print url.text
但我无法附加请求..
我可以在 sitemap.xml 中的任何链接中找到“Zoom”一词
非常感谢
【问题讨论】:
-
你的问题是……
-
更新有问题的代码而不是评论。
标签: python xml python-2.7 web-scraping beautifulsoup