【问题标题】:Request only meta tags from a webpage仅从网页请求元标记
【发布时间】:2015-10-25 13:55:45
【问题描述】:

有没有办法只请求 HTML 页面的头部而不需要下载完整的网页?我只对描述、关键字和标题(标签)等元标签感兴趣。

概括地说,是否有任何 HTTP 方法可用于仅从服务器请求特定标签而无需下载整个网页?

请告诉我。

【问题讨论】:

  • 熟悉一下http协议的'HEAD'方法。
  • @Axel 使用 HEAD 方法请求 HTML 页面不会产生任何 HTML。
  • @CodeCaster 哎呀,你是对的。不回答这个问题。
  • 您可以使用流式 HTML 解析器并在获得所需数据后关闭流(断开连接)。

标签: javascript http web-scraping meta


【解决方案1】:

您要查找的内容是在 HTML 级别定义的,即 HTTP 层之上的几个层。所以不,没有万无一失的方法来只从 HTML 页面请求某些标签。

鉴于这些标签必然会出现在页面的 <head> 部分中,但您可以在遇到 </head> 标签后停止阅读响应 - 如果 HTML 格式正确。

【讨论】:

    【解决方案2】:

    没有。

    最接近的 HTTP 是 the Range header,它允许您从支持它的服务器请求特定字节。

    问题在于,在请求之前,您无法可靠地知道文档的 head 部分将占用多少字节。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2017-09-22
      • 1970-01-01
      • 2015-05-21
      • 2011-01-17
      • 2013-02-14
      • 2013-04-01
      • 2016-11-20
      相关资源
      最近更新 更多