【发布时间】:2013-12-29 14:49:25
【问题描述】:
我想在我的苹果 mac 上编写 mapreduce 代码 - 最好使用 python - 在 hadoop 沙箱(例如 Hortonworks 或 Cloudera)上流式传输。
理想情况下,我的开发设置是使用我的 Apple Mac python 环境和一个 hadoop VM 沙箱(后来在同一网络上的一个集群)。
虽然有很多关于如何从 hadoop 集群的节点(例如从 NameNode 等)连接或流式传输代码的描述,但我不清楚从集群外部做什么。
例如我假设我需要安装一些 hadoop 客户端库? 我从哪里获得这些库?
如何安装它们?
哪种类型的python包效果最好?
我应该使用什么 IP 地址来传输我的 python 代码?
任何帮助 - 以及任何指向涵盖此内容的教程的链接 - 都会很棒!
【问题讨论】:
-
更新 - 我的下一个试验将使用 WebHDFS API,这似乎适合我的需要。
标签: python macos hadoop streaming hadoop-streaming