【问题标题】:Getting metadata from links using BeautifulSoup使用 BeautifulSoup 从链接中获取元数据
【发布时间】:2016-12-31 19:58:36
【问题描述】:

我正在尝试抓取链接以获取标题、描述和图片,以便对文章或网页进行简要概述。目前我有 og:title 通过 BeautifulSoup 获取元属性。这适用于新闻文章。

if tag.get("property", None) == "og:title":       
        scraper.title = tag.get("content", None)

但是,links for an Amazon Echo for example,请勿拉取任何图片或产品标题。我怎样才能使用 BeautifulSoup 和 Python 来做这件事,并从任何网站提取找到的第一张图片和标题——也许不仅仅是 opengraph 支持的一个?

【问题讨论】:

    标签: python django amazon-web-services beautifulsoup facebook-opengraph


    【解决方案1】:

    unicontent 是一个试图实现这一目标的库。它将获取 opengraph 标签或 HTML 标签,或其他类型的标签。我不认为它可以得到页面内的第一张图片。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2015-01-03
      • 2020-09-09
      • 1970-01-01
      • 2021-01-01
      • 2017-08-04
      • 1970-01-01
      • 2016-02-16
      • 1970-01-01
      相关资源
      最近更新 更多