【发布时间】:2019-11-01 21:08:02
【问题描述】:
我有多个 TB 文件需要加载到位于云中高性能 AZURE SQL 服务器之上的数据库中。
现在我正在尝试通过 SSIS 包加载这些文件,完成 5 个文件需要 12 多个小时。
我相信 Azure 中的 HDInsight/Data Bricks 可以使用 Ambari 和其他 UI 进行大数据 ETL 处理和分析数据。但是是否可以使用相同的(HDInsight 或 DataBricks)将巨大的数据文件加载到 SQL 表/数据库中? (就像使用集群在并行执行模式下加载多个文件一样)
非常感谢任何建议/帮助
【问题讨论】:
-
您的太字节文件的格式类型是什么? CSV 还是其他格式类型?
-
是.dat,类似的过程有.txt格式
-
那么你的
.dat文件可以逐行读取,解析一行得到一条记录?您是否将这些文件上传到 Azure 云服务(如 Azure Blob 存储)? -
是的,它可以按行读取。不,我没有上传这个 azure blob 存储文件,它位于 SQL 云数据库服务器中
标签: azure azure-sql-database azure-hdinsight ambari azure-databricks