【问题标题】:Azure Data Lake Gen 1 vs Gen 2Azure 数据湖第 1 代与第 2 代
【发布时间】:2018-08-10 08:46:21
【问题描述】:
最近 Azure announced Data Lake Gen 2 预览版。据我所知,第 1 代和第 2 代(在功能方面)的主要区别在于对象存储和文件系统同时访问相同的数据。其他区别包括价格、可用位置等。谁能解释第 1 代和第 2 代之间的其他主要区别是什么?
【问题讨论】:
标签:
azure
azure-data-lake
【解决方案2】:
Azure 数据湖存储 Gen2 是 Azure 数据湖 Gen 1 的超级集合。它也被微软称为“不妥协的数据湖”。第 2 代扩展了 Azure blob 存储功能,并且针对分析工作负载进行了最佳优化。由于它支持原子文件和文件夹操作,因此它可以存储一次数据并通过现有的 blob 存储和符合 HDFS 的文件系统接口进行访问,而无需在进行数据库操作时进行编程更改或数据复制。
目前,它仅在美国西部 2 和美国中西部数据中心可用。但据微软称,它将在不久的将来扩展到其他数据中心。
【解决方案3】:
有一个 Microsoft doc 讨论了这些差异。例如:
数据组织:
第一代
第二代
地理冗余:
第一代
第二代
生态系统:
第一代
- HDInsight (3.6)、Azure Databricks(3.1 及以上)、SQL DW、ADF
第二代
- HDInsight(3.6、4.0)、Azure Databricks(5.1 及更高版本)、SQL DW、ADF
【解决方案4】:
除了以下差异之外,当使用 ADF 连接到 Azure 数据湖分析存储帐户时,我们需要为 Linked Service 选择 Gen1,而对于 Blob 或存储帐户,我们需要选择 Gen2。
【解决方案5】:
Azure gen1 与 Hdfs 交互。它支持几个原因,但存储帐户支持所有区域,r 集成和 Microsoft 发布的新版本称为 zen2
Zen2 它是 Blob 存储和 zen1 的组合
这意味着 zen2 构建在 azure blob 存储之上
如果你想创建 zen2 帐户需要去一个存储帐户去提前启用 gen2
【解决方案6】:
主要区别在于 U-SQL(Gen1) 和 T-SQL(Gen2)。
U-SQL 和 T-SQL 之间的区别在于,PolyBase 通过允许针对这些文件编写 T-SQL 的模式化视图将 T-SQL 扩展到非结构化数据(文件),而 U-SQL 本身对非结构化数据和通过内置的 EXTRACT 表达式虚拟化对其他 SQL 数据源的访问,该表达式允许您动态地对非结构化数据进行模式化,而无需为其创建元数据对象。
除此之外,Gen2 还支持 ZRS、GRS、RA-GRS 以及 LRS。