【问题标题】:cannot find url from a warc file crawled from common crawl无法从从普通爬网爬取的 warc 文件中找到 url
【发布时间】:2017-07-17 11:56:45
【问题描述】:

我已经从普通爬取中爬取了数据,我想找出每条记录对应的url。

for record in files:
     print record['WARC-Target-URI']

这会输出一个空列表。我指的是以下链接 https://dmorgan.info/posts/common-crawl-python/。我们是获取对应于每条记录的目标 uri,还是只获取一个 warc 文件路径的目标 uri?

【问题讨论】:

  • 如果没有详细的日志,很难理解是什么原因。
  • 您是否更新了 dmorgan.info 中的示例,以便 URL 和路径指向正确的数据位置。数据已于去年移至存储桶 s3://commoncrawl/(参见 CC group): 1. 删除路径前缀 common-crawl/ 2. 将 URL 中的主机更改为 commoncrawl.s3.amazonaws.comhttps://aws-publicdatasets.s3.amazonaws.com/common-crawl/ 变为 https://commoncrawl.s3.amazonaws.com/
  • 是的,我有相应的路径,我可以看到 record.payload.read() 的值,但 record['WARC-Target-URI'] 没有返回任何内容。 record['Content-Language'] 的情况也是如此
  • record['WARC-Target-URI'] 应该存在,除了第一个“warcinfo”记录。 Content-Language 不是 WARC 记录头的一部分。它是record.payload 中的 HTTP 标头的一部分。

标签: python record common-crawl warc


【解决方案1】:

您所追求的信息是标题的一部分。试试:

print record.header['WARC-Target-URI']

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-10-16
    • 1970-01-01
    相关资源
    最近更新 更多