【问题标题】:Load multiple terabyte files in a parallel execution into AZURE cloud SQL database将多个 TB 文件并行加载到 AZURE 云 SQL 数据库中
【发布时间】:2019-11-01 21:08:02
【问题描述】:

我有多个 TB 文件需要加载到位于云中高性能 AZURE SQL 服务器之上的数据库中。

现在我正在尝试通过 SSIS 包加载这些文件,完成 5 个文件需要 12 多个小时。

我相信 Azure 中的 HDInsight/Data Bricks 可以使用 Ambari 和其他 UI 进行大数据 ETL 处理和分析数据。但是是否可以使用相同的(HDInsight 或 DataBricks)将巨大的数据文件加载到 SQL 表/数据库中? (就像使用集群在并行执行模式下加载多个文件一样)

非常感谢任何建议/帮助

【问题讨论】:

  • 您的太字节文件的格式类型是什么? CSV 还是其他格式类型?
  • 是.dat,类似的过程有.txt格式
  • 那么你的.dat文件可以逐行读取,解析一行得到一条记录?您是否将这些文件上传到 Azure 云服务(如 Azure Blob 存储)?
  • 是的,它可以按行读取。不,我没有上传这个 azure blob 存储文件,它位于 SQL 云数据库服务器中

标签: azure azure-sql-database azure-hdinsight ambari azure-databricks


【解决方案1】:

既然你提到了 SSIS,我想知道你是否考虑过使用 Azure 数据工厂的选项(我个人认为这是云上 SSIS 的下一个版本),复制活动应该可以解决问题,它确实支持并行执行 。由于您正在考虑 SQL Azure,我们需要考虑接收端的拥塞问题,我的意思是所有 TB 文件尝试同时写入 SQL 表的场景。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-10-18
    • 2021-03-14
    • 1970-01-01
    • 1970-01-01
    • 2017-05-23
    • 1970-01-01
    • 2017-08-05
    • 2021-08-26
    相关资源
    最近更新 更多