【发布时间】:2016-01-06 23:38:50
【问题描述】:
我是 Hadoop 和大数据的新手。我们每天都有数百个日志文件。每个文件约为 78Mb。因此,我们认为我们可以从 Hadoop 作业中受益,我们可以编写 Pig UDF 并提交到 Amazon EMR。
我们做了一个非常简单的 Pig UDF
public class ProcessLog extends EvalFunc<String> {
// Extract IP Address from log file line by line and convert that to JSON format.
}
它在本地与 Pig 和 hadoop 一起工作。因此,我们提交给 Amazon EMR 并使用 5x x-large 实例运行。大约花了40分钟才完成。因此,我们认为如果我们将实例数加倍(10 倍 x 大),我们会更快地获得结果,但最终会变慢。在编写 Pig UDF 以更快地得到结果时,我们需要考虑哪些因素?
【问题讨论】:
标签: hadoop amazon-web-services apache-pig