【发布时间】:2012-12-12 08:03:08
【问题描述】:
我是 mrjob 的新手,在 Amazon EMR 上运行作业时遇到问题。我会按顺序写。
- 我可以在本地计算机上运行 mrjob。但是,当我在 /home/ankit/.mrjob.conf 和 /etc/mrjob.conf 中有 mrjob.conf 时,该作业不会在我的本地计算机上执行。 这就是我得到的。 https://s3-ap-southeast-1.amazonaws.com/imagna.sample/local.txt
- 文档中“MR_CONF指定的位置”中的MRJOB_CONF是什么?
- “base_tmp_directory”有什么用?另外,我是否需要在开始作业之前上传 S3 中的输入数据,否则它将在开始执行时从我的本地计算机加载?
- 如果我使用 numpy、scikit 等库,是否需要进行引导?如果是,怎么做?
- 这是我在执行 EMR https://s3-ap-southeast-1.amazonaws.com/imagna.sample/emr.txt 上运行作业的命令时得到的结果
有什么解决办法吗?
非常感谢。
【问题讨论】:
标签: python hadoop mapreduce elastic-map-reduce mrjob