【问题标题】:python client on Os X streaming on hadoop sandboxOs X 上的 python 客户端在 hadoop 沙箱上流式传输
【发布时间】:2013-12-29 14:49:25
【问题描述】:

我想在我的苹果 mac 上编写 mapreduce 代码 - 最好使用 python - 在 hadoop 沙箱(例如 Hortonworks 或 Cloudera)上流式传输。

理想情况下,我的开发设置是使用我的 Apple Mac python 环境和一个 hadoop VM 沙箱(后来在同一网络上的一个集群)。

虽然有很多关于如何从 hadoop 集群的节点(例如从 NameNode 等)连接或流式传输代码的描述,但我不清楚从集群外部做什么。

例如我假设我需要安装一些 hadoop 客户端库? 我从哪里获得这些库?

如何安装它们?

哪种类型的python包效果最好?

我应该使用什么 IP 地址来传输我的 python 代码?

任何帮助 - 以及任何指向涵盖此内容的教程的链接 - 都会很棒!

【问题讨论】:

  • 更新 - 我的下一个试验将使用 WebHDFS API,这似乎适合我的需要。

标签: python macos hadoop streaming hadoop-streaming


【解决方案1】:

您是正确的,您需要安装客户端库来提交作业。

很遗憾,尝试在 OS X 中提交流式传输作业可能不是最佳选择。我这么说是因为 OS X 没有任何供应商支持的软件包,所以它不是安装 Hadoop 的最简单平台,至少以供应商支持的方式。如果您已经准备好沙盒设置,只需在 Mac 上编写作业并在 VM 中提交。

如果你必须的话,有一些安装选项。您可以使用homebrew,尽管我不确定将安装哪个版本或者是否有供应商特定的公式可用。您也可以自己下载和构建 hadoop,例如使用 Cloudera 压缩包here。设置好客户端后,您必须配置 mapred-site.xml、core-site.xml 和 hdfs-site.xml 以与在沙箱 VM 内运行的集群通信。

【讨论】:

猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-08-06
  • 1970-01-01
  • 1970-01-01
  • 2013-05-05
相关资源
最近更新 更多