【问题标题】:What is apache zeppelin? [closed]什么是 apache zeppelin? [关闭]
【发布时间】:2016-10-08 04:24:21
【问题描述】:

正如我们经常听到的关于 apache zeppelin 的消息,我们想到的问题很少:

  1. 什么是 Apache zeppelin?
  2. 它为大数据生态系统增添了哪些新内容和/或额外内容?
  3. 是否已经替换了某些框架/工具 存在于大数据生态系统中?

【问题讨论】:

  • 你看过官方页面的描述了吗?它说什么 ?至于问题 2 和 3,恐怕他们是在偏离主题。我投票结束这个问题。

标签: apache-spark bigdata apache-zeppelin


【解决方案1】:

什么是笔记本界面?

用于交互式运行代码、探索和可视化数据的界面。它们允许您混合叙事、富媒体和数据。


简答: 支持数据驱动的基于网络的笔记本, 使用 SQL、Scala 等进行交互式数据分析和协作文档。

长答案:

  1. Zeppelin 笔记本为您提供了一种在网络笔记本中执行任意代码的简单直接的方法。您可以执行 Scala、SQL,甚至可以安排作业(通过 cron)定期运行。

  2. 首先,在同一个笔记本中混合语言更容易。您可以执行一些 SQL、scala 和 markdown 来将它们全部记录在一起。您还可以轻松地将您的笔记本转换为演示样式 - 用于向管理层演示或在仪表板中使用。

  3. 在 Python 社区中非常流行的 Jupyter(以前称为 IPython)笔记本。我不能使用“替换”这个词,而是我会使用类似的......

Further more.

  • Zeppelin 支持带有依赖加载器的 Spark、PySpark、Spark R、Spark SQL。

  • Zeppelin 让您可以无缝连接任何 JDBC 数据源。 Postgresql、Mysql、MariaDB、Redshift、Apache Hive 等。

  • Matplotlib、Conda、Pandas SQL 和 PySpark 集成支持 Python。

【讨论】:

    【解决方案2】:

    Zeppelin 是一个很棒的工具。它允许在单个笔记本中使用不同的后端/语言。这是一个简单的用例。

    1. 使用 Markdown 写一些描述
    2. 使用 Shell 准备数据。例如使用 curl/wget 下载文件,注入 HDFS
    3. 使用 Spark 进行数据分析
    4. 使用 SQL 进行简单的可视化
    5. 使用 Shell 导出结果
    6. 发布带有链接的图表

    所有这些步骤都可以在一个笔记本中完成。还有更多可以在一个笔记本中完成。

    Zeppelin 非常接近 Databricks.com 在线解决方案

    【讨论】:

    • databricks 笔记本,你是说。 databricks 即服务不仅仅是他们的笔记本实现,但可以公平地说,他们在开源上构建了所​​有东西,可能包括扩展 zeppelin。
    猜你喜欢
    • 2016-05-17
    • 2010-10-07
    • 2013-04-14
    • 2016-09-13
    • 2016-09-09
    • 2015-08-04
    • 2010-11-01
    • 2017-04-23
    • 2017-03-04
    相关资源
    最近更新 更多