【发布时间】:2015-03-14 06:03:44
【问题描述】:
我的任务是弄清楚如何扩展 spark 的 api 以包含一些自定义钩子,以供 iPython Notebook 等另一个程序使用。我已经浏览过quick start guide、the cluster mode overview、submitting applications doc 和this stack overflow question。我所看到的一切都表明,要在 Spark 中运行某些东西,您需要使用
火花提交
实现它。因此,我编写了一些代码,visas vis spark,将前十行测试数据从我创建的累积表中提取出来。然而,我的团队负责人告诉我修改 spark 本身。这是完成我描述的任务的首选方式吗?如果是这样,为什么?价值主张是什么?
【问题讨论】:
-
真的吗?否决票?伙计,这真是胆小鬼。阅读问题并发表深思熟虑的批评真的有那么难吗?
-
请详细说明“自定义挂钩”:您要达到什么目的(不,我没有投反对票:您的问题是一个合理的开始)。具体来说 - SqlContext 或 RDD 是否需要其他功能?或者你可以结合现有的来满足你的需求吗?
-
@javadba - 感谢您的回复 - 如果您投了反对票,那就太好了!我最近对 SO 允许匿名路过投票的政策感到非常沮丧。我们正在努力在 spark 和 accumulo 之间创建一个链接,以便像 Notebook 这样的东西可以坐在 spark 上并访问 accumulo 数据,使用 spark 来执行 map reduce 操作等等。至于究竟需要什么——在这一点上我没有' t 从我的领导那里收到了详细信息。然而,他确实将我指向 geomesa 并告诉我阅读他们的代码,我现在正在这样做。
-
我继续在下面创建了一个一般性答案 - 但不确定它在多大程度上可能会有所帮助。我也不喜欢通过投票来推动(并且在考虑了一下之后对您的问题进行了投票)
标签: apache-spark