【问题标题】:What is the difference between Data Wrangling and ETL (Extract, Transform, and Load)?数据整理和 ETL(提取、转换和加载)有什么区别?
【发布时间】:2019-11-08 02:23:12
【问题描述】:

我对 ETL 的基本理解是,像数据分析师这样的人会使用它。 ETL 将用于从数据库 (MySQL) 中提取数据,转换为 Excel 之类的东西,其中应用了业务规则(Excel 函数),然后加载到另一个应用程序的新数据库中。当谈到这与数据争论有何不同时,我感到非常困惑。从我收集的内容来看,只有一些区别。 1、使用技术的人不同。数据争论可能是数据工程师与 ETL 和数据分析师的工作。 2、使用的技术不同。 Data Wrangling 将使用 Apache Spark 或 Hadoop 生态系统之类的东西。 ETL 将使用 Excel、Access 或云数据库等工具来提取数据。从本质上讲,我的理解是数据争论是对原始数据的“ETL-ing”,这意味着数据没有被建模——(它不在模式中)。 (也许您在争吵时必须解析转发、喜欢和收藏等数据)?只是好奇我是否在赛道上。我试过阅读一些文章,但对我来说仍然没有意义。谁能提供一个简单的解释,以便我可以围绕这个概念展开思考?谢谢。

【问题讨论】:

    标签: apache-spark etl data-science


    【解决方案1】:

    数据整理是转换/清理从源流向目标的数据的过程。有多种方法可以进行这种转换或清理:-

    “小”数据集

    对于可以在excel中打开的小数据集,清理规则的转换可以通过宏等的帮助在excel中定义。如果你想重复这样做,你可以构建bat(windows)或shell(linux ) 脚本并通过 cron 或 windows 调度程序安排它们。

    一个简单的例子是将 NULL 替换为大小为 10 MB 的文件中的某个值

    “中等”数据集

    当数据集大小无法在 excel 中打开时,您可以使用脚本或编程语言执行相同的操作,并使用提到的调度程序示例对其进行调度。此类脚本语言通常在单台机器上运行,性能与机器配置成正比

    一个简单的例子是将 NULL 替换为 10 GB 文件中的某个值

    “大型”数据集

    当数据集较大时,无法在excel中打开,在单机上运行清理规则可能会很慢。这就是 Big Data 技术(如 Map reduce、Spark 等)大放异彩的地方,其中数据子集被发送到多台机器,清洗规则应用于每台机器上的数据子集,从而提高了整个处理的吞吐量。

    一个简单的例子是将 NULL 替换为大小为 500 GB 的文件中的某个值

    【讨论】:

    • 所以区别在于您使用的技术以及您对这些数据的处理方式,但过程本质上是相同的?
    猜你喜欢
    • 2011-03-24
    • 1970-01-01
    • 1970-01-01
    • 2014-08-02
    • 2010-11-01
    • 2011-03-30
    • 1970-01-01
    • 1970-01-01
    • 2014-07-18
    相关资源
    最近更新 更多