【问题标题】:extract Meta tags from website using portia (scrapy)使用 portia (scrapy) 从网站中提取 Meta 标签
【发布时间】:2014-11-27 07:55:34
【问题描述】:

使用 portia (scrapy) 从网站中提取 Meta 标签

我想用portia从一些网站中提取元标签,但它没有显示头标签,它只从body标签开始

我只能从body标签中提取数据

【问题讨论】:

    标签: python scrapy web-crawler portia


    【解决方案1】:

    您需要在body 中注释一个元素,然后导航到head 中要映射的元素。

    1. 在页面上标注一个元素,不管是哪一个。
    2. 在注释弹出窗口或右侧工具箱的注释面板中单击设置图标。
    3. 单击html 元素。您将收到一条警告,指出您将丢失注释的任何映射属性,请单击“确定”。
    4. 再次点击设置图标,这次选择head元素。
    5. 再次单击设置图标,您可以在head 中选择子元素。
    6. 选择元素后,单击+ Field 按钮创建一个新字段,然后将所需的属性值映射到目标字段。

    另请参阅:https://github.com/scrapinghub/portia/issues/60

    【讨论】:

      【解决方案2】:

      您可以将其用于元名称:

      meta_name = hxs.select('//meta/@name').extract()
      

      这对于元内容:

      meta_content = hxs.select('//meta/@content').extract()
      

      这用于具有特定名称的元内容,例如描述:

      meta = hxs.select('//meta[@name=\'description\']/@content').extract()
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2021-10-10
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2020-02-19
        • 1970-01-01
        • 2021-01-09
        • 1970-01-01
        相关资源
        最近更新 更多