【问题标题】:How to set up metadata database for Spark SQL?如何为 Spark SQL 设置元数据数据库?
【发布时间】:2018-12-19 04:26:04
【问题描述】:

Hive 可以有它的元数据并在那里存储表、列、分区信息。 如果我不想使用蜂巢。我们可以为火花创建与蜂巢相同的元数据吗? 我想查询 Spark SQL(不使用数据框),例如 Hive(选择、来自和在哪里)我们可以这样做吗?如果是,我们可以使用哪个关系数据库来存储元数据?

【问题讨论】:

    标签: apache-spark apache-spark-sql


    【解决方案1】:

    我们能否为 spark 创建与 hive 相同的元数据。

    Spark 会为您执行此操作,您不必使用单独的 Hive 安装,甚至只需安装其中的一部分(例如 Hive 元存储)。

    无论您使用的是哪种 Apache Spark 安装,Spark SQL 在内部都使用 Hive 元存储,其目的与 Hive 相同(但元存储现在是 Spark SQL 的一部分)。

    如果是,我们可以使用哪个关系数据库来存储元数据?

    Hive 支持的任何东西,例如甲骨文、MySQL、PostgreSQL。配置与单独的 Hive 安装非常相似(在此类企业安装中通常是这种情况)。

    您可能想阅读Hive Metastore

    【讨论】:

      【解决方案2】:

      Spark 本质上是一个分布式计算系统,而不是分布式存储。因此,我们主要使用 Spark 来做计算工作,这需要来自不同存储的元数据。

      但是,如果未配置 Hive,Spark 会在内部提供一个 InMemoryCatalog 来存储元数据。

      您可以查看this 了解更多信息。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2010-11-23
        • 1970-01-01
        • 2012-05-22
        • 2016-11-06
        • 2011-03-01
        相关资源
        最近更新 更多