【发布时间】:2017-07-17 11:56:45
【问题描述】:
我已经从普通爬取中爬取了数据,我想找出每条记录对应的url。
for record in files:
print record['WARC-Target-URI']
这会输出一个空列表。我指的是以下链接 https://dmorgan.info/posts/common-crawl-python/。我们是获取对应于每条记录的目标 uri,还是只获取一个 warc 文件路径的目标 uri?
【问题讨论】:
-
如果没有详细的日志,很难理解是什么原因。
-
您是否更新了 dmorgan.info 中的示例,以便 URL 和路径指向正确的数据位置。数据已于去年移至存储桶 s3://commoncrawl/(参见 CC group): 1. 删除路径前缀
common-crawl/2. 将 URL 中的主机更改为commoncrawl.s3.amazonaws.com。https://aws-publicdatasets.s3.amazonaws.com/common-crawl/变为https://commoncrawl.s3.amazonaws.com/ -
是的,我有相应的路径,我可以看到 record.payload.read() 的值,但 record['WARC-Target-URI'] 没有返回任何内容。 record['Content-Language'] 的情况也是如此
-
record['WARC-Target-URI']应该存在,除了第一个“warcinfo”记录。Content-Language不是 WARC 记录头的一部分。它是record.payload中的 HTTP 标头的一部分。
标签: python record common-crawl warc