【问题标题】:Multicore computing with Rhadoop使用 Rhadoop 进行多核计算
【发布时间】:2013-03-11 08:49:28
【问题描述】:

我试图用 Rhadoop 计算一些东西(R 和 hadoop 之间的链接)。

当我使用 Hadoop-1.0.4 中的嵌入式示例对集群进行基准测试时,它看起来运行良好。 (我的意思是所有从节点的核心都工作了,虽然 CPU 使用率在 50% 到 100% 之间波动)

但是,当我应用 Rhadoop 的示例时,情况并非如此。 (每个从节点只激活一个核。)

我必须在 Rhadoop 中设置任何配置吗?(就像我对 hadoop 的配置文件所做的那样,例如 core-site.xml)

谢谢

【问题讨论】:

  • 请让您的情况可重现,即向我们提供模拟您的情况所需的数据和代码。有关如何执行此操作的更多提示,请参阅 stackoverflow.com/questions/5963269/…
  • 抱歉,我没有您要求的权限。我会请他(我的同事)给我他的代码并获得上传它的权限。感谢您的评论。

标签: r hadoop multicore rhadoop


【解决方案1】:

您可能在谈论 rmr2,它是 RHadoop 的一部分。 rmr2 对此没有特定的配置。 help(rmr.options) 将显示所有配置选项。 map 任务和 map slot 的数量决定了 map 阶段的并行度。听起来你有足够的插槽。所以地图任务的数量可能不足。它可能取决于输入的大小和其他属性。您可以向 mapreduce backend.parameters = list(hadoop = list(D = 'mapred.map.tasks')) 传递一个附加参数,但 hadoop 不会逐字遵守此设置,只是将其作为提示。 backend.parameters 参数已被弃用,但当它被删除时,将为这个特定目标提供一些替代机制。如果问题在 reduce 阶段,key 集合的基数也很重要(它设置了并行度的上限)。我同意保罗的观点,如果你提供了一个可重复的例子,我的答案将包含更少的猜测。 RHadoop 有一个专门的论坛,开发者和用户都很活跃https://groups.google.com/forum/?fromgroups=#!forum/rhadoop

【讨论】:

  • 谢谢,我会按照你写的去做,并尽快提供结果。
猜你喜欢
  • 1970-01-01
  • 2013-10-12
  • 1970-01-01
  • 2015-05-25
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-06-16
  • 1970-01-01
相关资源
最近更新 更多