在实际数仓开发中,我们经常会遇到多表关联,这个时候就会涉及到where与on的使用
Hive中的where与on在HQL中的区别为:
首先,来看一个例子:使用a表指定数据关联b表:
写法一:
select * from a left join b on a.id=b.id where a.id='1';
写法二:
select * from a left join b on a.id=b.id and a.id='1';
写法三:
select * from (select * from a where id='1') t left join b on t.id=b.id;
三种写法的结果是等同的,也没有问题。如果需要以b表作为主表,关联查询a表,只需要修改连接类型为右外连接就可以了
但三种写法存在效率上的差异!
写法一与写法三都为高效写法,Hive只会取指定的数据进行join
写法二则效率较低,Hive先会查出所有数据进行join,然后再去过滤指定的数据
这可以通过explain执行计划证明:
写法一和写法三:

写法二:

从执行计划可以得出,写法一和写法三的数据在一开始扫描时候就已经过滤了。而写法二会拿所有的数据先进行查询join,然后再进行过滤
这种将过滤表达式提前执行的过程我们称为谓词下推
谓词下推(Predicate Pushdown,PPD)是指将过滤表达式尽可能移动至靠近数据源的位置,以使真正执行时能直接跳过无关的数据。简而言之,就是在合适的场景下,优先执行过滤条件

在Hive生成物理执行计划中,有一个配置项用于管理谓词下推优化是否开启:
set hive.optimize.ppd=true;
需要注意的是,Hive的PPD控制参数默认开启
Hive官网谓词下推介绍:https://cwiki.apache.org/confluence/display/Hive/OuterJoinBehavior
基本概念:
R1 join R2 on R1.x = 5中,谓词R1.x = 5是JOIN中的谓词R1 join R2 on R1.m = R2.n where R1.x = 5中,谓词R1.x = 5是JOIN后的谓词官网对谓词下推规则的概括如下:
总结来说就是:
因此,可以得到如下谓词下推规则表:
| item | [inner] join | left [outer] join | right [outer] join | full [outer] join | ||||
|---|---|---|---|---|---|---|---|---|
| left table | right table | left table | right table | left table | right table | left table | right table | |
| where | PPD | PPD | PPD | Not PPD | Not PPD | PPD | Not PPD | PPD |
| on | PPD | PPD | Not PPD | PPD | PPD | Not PPD | Not PPD | Not PPD |
Hive谓词下推规则表中各场景分析案例详见文章:传送门