【问题标题】:What is filter pushdown optimization?什么是过滤器下推优化?
【发布时间】:2021-08-09 13:36:44
【问题描述】:

你能举一些例子吗?

【问题讨论】:

    标签: sql algorithm apache-spark data-structures data-science


    【解决方案1】:

    首先,为“过滤器下推”找到一个正确的定义here

    防止加载实际上不需要的数据的一种方法是过滤器下推(有时也称为谓词下推),它可以在数据源加载之前在数据源执行某些过滤器一个执行者进程。如果执行器与数据不在同一台物理机器上,这将变得更加重要。

    注意:

    在许多情况下,Spark 会自动应用过滤器下推,无需用户明确命令或输入。但在某些情况下,用户必须提供特定信息甚至自己实现某些功能,尤其是在创建自定义数据源时,即针对不受支持的数据库类型或不受支持的文件类型。

    现在,您可以在databricks 中找到一个简单的示例。在这个例子中,您可以发现 select 和 filter 的顺序可以针对查询执行性能进行优化。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-07-18
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-07-08
      • 2020-07-24
      • 2014-10-12
      相关资源
      最近更新 更多