【发布时间】:2019-09-09 18:02:48
【问题描述】:
我有兴趣下载 AWS Common Crawl 的一小部分的原始文本,即 10 兆的顶部,作为信息检索测试的语料库。
Common Crawl 页面建议我需要一个 S3 帐户和/或 Java 程序来访问它,然后我正在考虑筛选 100 Gb 的数据,而我只需要几十兆。
有some code here,但它需要一个 S3 帐户和访问权限(尽管我确实喜欢 Python)。
有没有一种方法可以形成一个 http(s) URL,让我得到一个很小的横截面来满足我的目的?我相信我查看了一个页面,该页面建议了一种使用天、小时、分钟来构建目录的方法,但我似乎无法再次找到该页面。
谢谢!
【问题讨论】:
标签: dataset information-retrieval corpus common-crawl