【发布时间】:2014-01-25 08:36:04
【问题描述】:
我目前正在开发一个新闻再发布网站,该网站从 rss 提要中读取新闻。问题是当我尝试从每个网站不同的不同新闻机构获取新闻徽标图像时。目前我正在为 200 个网站使用大约 200 个 IF 命令。
这是我使用 python 的代码:
try:
img = soup.body.find('div', {'class': 'image-wrap'}).img.attrs['src']
Image.open(cStringIO.StringIO(urllib2.urlopen(str(img)).read()))
except:
try:
img = soup.body.find('div', {'id': 'post-body'}).a.attrs['href']
Image.open(cStringIO.StringIO(urllib2.urlopen(str(img)).read()))
except:
try:
img = soup.body.find('div', {'class': 'image'}).img.attrs['src']
except:
img = soup.head.find('meta', {'property': 'og:image'}).attrs['content']
if "breakingnews5.jpg" in img:
img = ""
是否可以在数据库中存储有关每个网站的信息并使用它来提取图像?
【问题讨论】:
标签: python rss html-parsing beautifulsoup