【问题标题】:Is there a way to read logo images from different news sources with an standard approach?有没有一种方法可以使用标准方法从不同的新闻来源读取徽标图像?
【发布时间】:2014-01-25 08:36:04
【问题描述】:

我目前正在开发一个新闻再发布网站,该网站从 rss 提要中读取新闻。问题是当我尝试从每个网站不同的不同新闻机构获取新闻徽标图像时。目前我正在为 200 个网站使用大约 200 个 IF 命令。
这是我使用 python 的代码:

try:
    img = soup.body.find('div', {'class': 'image-wrap'}).img.attrs['src']
    Image.open(cStringIO.StringIO(urllib2.urlopen(str(img)).read()))
except:
    try:
        img = soup.body.find('div', {'id': 'post-body'}).a.attrs['href']
        Image.open(cStringIO.StringIO(urllib2.urlopen(str(img)).read()))
    except:
        try:
            img = soup.body.find('div', {'class': 'image'}).img.attrs['src']
        except:
            img = soup.head.find('meta', {'property': 'og:image'}).attrs['content']
            if "breakingnews5.jpg" in img:
                img = ""

是否可以在数据库中存储有关每个网站的信息并使用它来提取图像?

【问题讨论】:

    标签: python rss html-parsing beautifulsoup


    【解决方案1】:

    如果您使用的是大约 200 项服务的固定列表,我建议您使用如此独立的代码构建字典或图像,以便您手动查看提要并选择作为徽标的图像并将其保存到 logos 目录中固定的命名约定。

    【讨论】:

    • 字典是如何格式化的?每个通讯社的格式都不一样。我该怎么办?
    • 而不是一个巨大的 if 语句,要么提出每个提要如何格式化其徽标并将指纹存储在 python 字典中的指纹,要么不要尝试显示来自提要的徽标有你自己的为每个提要捕获的徽标。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-06-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-01-21
    相关资源
    最近更新 更多