【发布时间】:2012-02-20 15:21:45
【问题描述】:
对于我的一个统计项目,我需要从谷歌专利页面随机下载几个文件,每个文件都是一个大的 zip 文件。网页链接如下:
http://www.google.com/googlebooks/uspto-patents-grants-text.html#2012
具体来说,我想随机选择 5 年(页面顶部的链接)并下载(即 5 个文件)。你们知道是否有一些适合这项任务的好包吗?
谢谢。
【问题讨论】:
-
你为什么不直接下载所有的档案,把它们保存在磁盘上,然后做你随机的事情呢?我不知道你在用什么编程语言编写,但在 C# 中,这可以在大约 20 行代码中完成(给予或接受)。
-
确实如此,但由于这是一个团队项目,我们希望有一些脚本可以在线选择示例并仅下载选择的示例。所有这些文件都相当大,所以我们只想抓取我们需要的东西以节省一些内存空间。
标签: web web-crawler