【问题标题】:Download small sample of AWS Common Crawl to local machine via http通过 http 将 AWS Common Crawl 的小样本下载到本地机器
【发布时间】:2019-09-09 18:02:48
【问题描述】:

我有兴趣下载 AWS Common Crawl 的一小部分的原始文本,即 10 兆的顶部,作为信息检索测试的语料库。

Common Crawl 页面建议我需要一个 S3 帐户和/或 Java 程序来访问它,然后我正在考虑筛选 100 Gb 的数据,而我只需要几十兆。

some code here,但它需要一个 S3 帐户和访问权限(尽管我确实喜欢 Python)。

有没有一种方法可以形成一个 http(s) URL,让我得到一个很小的横截面来满足我的目的?我相信我查看了一个页面,该页面建议了一种使用天、小时、分钟来构建目录的方法,但我似乎无法再次找到该页面。

谢谢!

【问题讨论】:

    标签: dataset information-retrieval corpus common-crawl


    【解决方案1】:

    这很简单:只需从任何每月抓取中随机选择一个 WARC(WAT 或 WET)文件即可。爬取在这里公布:https://commoncrawl.org/connect/blog/

    1. 进行最新爬取(例如April 2019
    2. 导航到 WARC 文件列表并下载(WAT 或 WET 相同)
    3. 解压文件,随机选择一行(文件路径)
    4. 路径前缀https://commoncrawl.s3.amazonaws.com/(博文中有说明)并下载

    您失败了,因为每个 WARC/WAT/WET 文件本身就是一个随机样本。需要更多数据:随机选择更多文件。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2018-06-26
      • 2014-05-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多