【发布时间】:2012-01-29 21:21:40
【问题描述】:
我正在使用 nutch 和 hadoop 进行一些测试,我需要大量数据。 我想从 20GB 开始,到 100GB、500GB 并最终达到 1-2 TB。
问题是我没有这么多数据,所以我在想办法产生它。
数据本身可以是任何类型的。 一个想法是获取一组初始数据并复制它。但它还不够好,因为需要彼此不同的文件(忽略相同的文件)。
另一个想法是编写一个程序来创建带有虚拟数据的文件。
还有什么想法吗?
【问题讨论】:
-
从google analitycs查询数据?
-
哇,这样的程序需要大量时间才能运行。
-
你考虑过只生成随机数吗?
-
"(忽略相同的文件)。" 从末尾剪掉几行(随机数),它们就不会了。
-
为什么要生产?那里有大量免费的大型数据集:stackoverflow.com/questions/2674421/…