【问题标题】:Some elementary doubts about running Mapreduce programs using mrjob on Amazon EMR关于在 Amazon EMR 上使用 mrjob 运行 Mapreduce 程序的一些基本疑问
【发布时间】:2012-12-12 08:03:08
【问题描述】:

我是 mrjob 的新手,在 Amazon EMR 上运行作业时遇到问题。我会按顺序写。

  1. 我可以在本地计算机上运行 mrjob。但是,当我在 /home/ankit/.mrjob.conf 和 /etc/mrjob.conf 中有 mrjob.conf 时,该作业不会在我的本地计算机上执行。 这就是我得到的。 https://s3-ap-southeast-1.amazonaws.com/imagna.sample/local.txt
  2. 文档中“MR_CONF指定的位置”中的MRJOB_CONF是什么?
  3. “base_tmp_directory”有什么用?另外,我是否需要在开始作业之前上传 S3 中的输入数据,否则它将在开始执行时从我的本地计算机加载?
  4. 如果我使用 numpy、scikit 等库,是否需要进行引导?如果是,怎么做?
  5. 这是我在执行 EMR https://s3-ap-southeast-1.amazonaws.com/imagna.sample/emr.txt 上运行作业的命令时得到的结果

有什么解决办法吗?

非常感谢。

【问题讨论】:

    标签: python hadoop mapreduce elastic-map-reduce mrjob


    【解决方案1】:
    1. 您的网址无效(我收到“拒绝访问”错误)。
    2. mrjob.conf 是一个配置文件。它可以位于多个位置,请参阅http://pythonhosted.org/mrjob/configs-conf.html
    3. 您只需在命令行中指定输入文件的路径,即可使用本地计算机的输入数据。 MRJob 将为您将数据上传到 S3。如果您指定 s3://... URL,MRJob 将使用该 S3 路径中的数据。
    4. 要使用非标准包,请参阅http://pythonhosted.org/mrjob/writing-and-running.html#custom-python-packages
    5. 您的网址无效(我收到“拒绝访问”错误)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-08-08
      • 1970-01-01
      • 2012-04-02
      • 2021-09-28
      相关资源
      最近更新 更多