【发布时间】:2019-11-08 02:23:12
【问题描述】:
我对 ETL 的基本理解是,像数据分析师这样的人会使用它。 ETL 将用于从数据库 (MySQL) 中提取数据,转换为 Excel 之类的东西,其中应用了业务规则(Excel 函数),然后加载到另一个应用程序的新数据库中。当谈到这与数据争论有何不同时,我感到非常困惑。从我收集的内容来看,只有一些区别。 1、使用技术的人不同。数据争论可能是数据工程师与 ETL 和数据分析师的工作。 2、使用的技术不同。 Data Wrangling 将使用 Apache Spark 或 Hadoop 生态系统之类的东西。 ETL 将使用 Excel、Access 或云数据库等工具来提取数据。从本质上讲,我的理解是数据争论是对原始数据的“ETL-ing”,这意味着数据没有被建模——(它不在模式中)。 (也许您在争吵时必须解析转发、喜欢和收藏等数据)?只是好奇我是否在赛道上。我试过阅读一些文章,但对我来说仍然没有意义。谁能提供一个简单的解释,以便我可以围绕这个概念展开思考?谢谢。
【问题讨论】:
标签: apache-spark etl data-science