【问题标题】:Large number of sample documents大量样本文件
【发布时间】:2009-07-14 22:22:27
【问题描述】:

有谁知道我在哪里可以找到大量不同主题的示例文档库? 我正在寻找至少几千个文档(Office 或 PDF 应该没问题)以测试一些算法......这些文档应该有一些共同点 - 例如,一千个与编程相关的文档,另外一千个与生态学等等……

有人知道我在哪里可以买到吗?

【问题讨论】:

  • 您在过去 7 天里尝试了什么?任何答案有帮助吗?还是我应该将此问题重新标记为 plz-send-the-samplez? :)
  • 我还没有尝试过任何东西。虽然建议的解决方案很有趣,但它们并不能完全满足我的需求......
  • 这个问题是opendata.stackexchange.com的主题

标签: sample


【解决方案1】:

您是否尝试过使用维基百科?创建一个脚本:

  1. 调用http://en.wikipedia.org/wiki/Special:Random获取随机页面

  2. 1234563你。
  3. 通过 html->pdf 转换器管道生成的 html 内容。

  4. 重复 1000 次。

这应该会为您提供各种各样的内容。

【讨论】:

  • 我相信它也会在维基百科的数据中心结交一些朋友:p
  • 这种流量对他们来说不算什么 - 在每个请求之间添加一个小停顿以保持友好(并阻止他们阻止您尝试 ddos​​),并且没有问题。
  • 说真的。他们每秒获得数千次(如果不是数万或数十万次)点击。他们根本不会注意到。
【解决方案2】:

您可以使用 Yahoo Search API 上的高级搜索来指定您要查找的文档类型。

http://developer.yahoo.com/search/boss/boss_guide/Web_Search.html#optional_args_web

如果您想要大量的word文档,请指定您想要的文档类型,然后根据一些预先选择的关键字进行搜索。那应该会给你一堆文件。

您还可以通过指定文件类型(来自随机列表)来抓取高级 Google 搜索并抓取文档链接,例如:

http://www.google.co.in/search?q=monkey+badger+filetype%3Apdf

【讨论】:

  • 我很幸运地在 google 上搜索“manual filetype:pdf”来获得大而多样的 PDF 来测试解析。
【解决方案3】:

Ontheinternetzzz?

编辑:我?没有帮助? :)

import mechanize, urllib, os

template = r"http://www.google.com/search?q=filetype:pdf&hl=en&start=%s&sa=N"
links = []

br = mechanize.Browser()
br.set_handle_robots(False)
br.addheaders = [('User-agent', 'Firefox')]
for i in xrange(0, 30, 10):
    br.open(template % i)
    links.extend((link.url for link in br.links(url_regex="^http.+pdf$"))
for url in links:
    urllib.urlretrieve(url, os.path.basename(url))

【讨论】:

  • 是的,或者写一个简单的脚本给他做。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-10-25
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多