【发布时间】:2019-10-14 06:01:39
【问题描述】:
我们公司正在构建一套通用的内部 Spark 功能和作业,我想确保我们的数据科学家在 Zeppelin 中制作原型时能够访问所有这些功能。
理想情况下,我希望他们能够在 AWS EMR 上启动 Zeppelin 笔记本,并让我们构建的依赖 jar 自动加载到它上面,而无需他们每次都手动输入 maven 信息(私人仓库位置/凭证、包裹信息等)。
现在我们已经在 S3 上加载了依赖 jar,通过一些工作我们可以获得一个私有的 maven 存储库来托管它。
我看到 ZEPPELIN_INTERPRETER_DIR 保存了解释器设置,但我认为它不能从常见的默认位置(如 S3 或其他)加载
有没有办法告诉 EMR 集群上的 Zeppelin 从一个公共位置加载它的解释器设置?我不能成为第一个想要这个的人。
我有过但还没有尝试过的其他想法:
拥有一个脚本,该脚本使用 aws cmd 行选项来启动 EMR 集群,并为您预先做好所有必要的设置。 (如果我们无法让 maven 工作,也可以上传 .jar 依赖项)
使用基础架构即代码框架启动具有所需设置的集群。
【问题讨论】:
标签: amazon-web-services apache-spark amazon-s3 apache-zeppelin