【问题标题】:How to get a listing of WARC files using HTTP for Common Crawl News Dataset?如何使用 HTTP 为 Common Crawl News Dataset 获取 WARC 文件列表?
【发布时间】:2021-03-20 18:36:06
【问题描述】:

我可以通过以下方式获得 Common Crawl 的列表:

https://commoncrawl.s3.amazonaws.com/crawl-data/CC-MAIN-2017-09/wet.paths.gz

如何使用 Common Crawl News Dataset 做到这一点?

我尝试了不同的选项,但总是出错:

https://commoncrawl.s3.amazonaws.com/crawl-data/CC-NEWS-2017-09/warc.paths.gz

https://commoncrawl.s3.amazonaws.com/crawl-data/CC-NEWS/2017/09/warc.paths.gz

【问题讨论】:

    标签: amazon-web-services http common-crawl


    【解决方案1】:

    由于每隔几个小时就有一个新的 WARC 文件添加到新闻数据集中,因此静态文件列表没有意义。相反,您可以使用 AWS CLI 获取文件列表 - 按年或月的任何子集,例如

    aws --no-sign-request s3 ls --recursive s3://commoncrawl/crawl-data/CC-NEWS/2017/09/
    

    另请参阅news data release announcement

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-06-04
      • 2022-01-04
      • 1970-01-01
      相关资源
      最近更新 更多