SQL中ON和WHERE条件的区别

本文详细解析了SQL中的JOIN操作,特别是LEFT JOIN和RIGHT JOIN在ON与WHERE条件中的使用区别,以及这些条件如何影响查询结果。

数据库在通过连接两张或多张表来返回记录时,都会生成一张中间的临时表,然后再将这张临时表返回给用户。
在使用left jion时,on和where条件的区别如下:

1、on条件是在生成临时表时使用的条件,它不管on中的条件是否为真,都会返回左边表中的记录。

2、where条件是在临时表生成好后,再对临时表进行过滤的条件。这时已经没有left join的含义(必须返回左边表的记录)了,条件不为真的就全部过滤掉。

假设有两张表:

表1:

tab1

id size
1 10
2 20
3 30
表2:

tab2

size name
10 AAA
20 BBB
20 CCC


两条SQL:
1、select * form tab1 left join tab2 on (tab1.size = tab2.size) where tab2.name=’AAA’
2、select * form tab1 left join tab2 on (tab1.size = tab2.size and tab2.name=’AAA’)

第一条SQL的过程:

1、中间表
on条件:
tab1.size = tab2.size 

tab1.id tab1.size tab2.size tab2.name
1 10 10 AAA
2 20 20 BBB
2 20 20 CCC
3 30 (null) (null) 
 
2、再对中间表过滤
where 条件:
tab2.name=’AAA’
tab1.id tab1.size tab2.size tab2.name
1 10 10 AAA
 
   
 

第二条SQL的过程:

1、中间表
on条件:
tab1.size = tab2.size and tab2.name=’AAA’
(条件不为真也会返回左表中的记录)

tab1.id tab1.size tab2.size tab2.name
1 10 10 AAA
2 20 (null) (null)
3 30 (null) (null)
 
 

其实以上结果的关键原因就是left join,right join,full join的特殊性,不管on上的条件是否为真都会返回left或right表中的记录,full则具有left和right的特性的并集。 而inner jion没这个特殊性,则条件放在on中和where中,返回的结果集是相同的。

on、where、having的区别
 

on、where、having这三个都可以加条件的子句中,on是最先执行,where次之,having最后。有时候如果这先后顺序不影响中间结果的话,那最终结果是相同的。但因为on是先把不符合条件的记录过滤后才进行统计,它就可以减少中间运算要处理的数据,按理说应该速度是最快的。   
   
根据上面的分析,可以知道where也应该比having快点的,因为它过滤数据后才进行sum,所以having是最慢的。但也不是说having没用,因为有时在步骤3还没出来都不知道那个记录才符合要求时,就要用having了。   
   
在两个表联接时才用on的,所以在一个表的时候,就剩下where跟having比较了。在这单表查询统计的情况下,如果要过滤的条件没有涉及到要计算字段,那它们的结果是一样的,只是where可以使用rushmore技术,而having就不能,在速度上后者要慢。   
   
如果要涉及到计算的字段,就表示在没计算之前,这个字段的值是不确定的,根据上篇写的工作流程,where的作用时间是在计算之前就完成的,而having就是在计算后才起作用的,所以在这种情况下,两者的结果会不同。   
   
在多表联接查询时,on比where更早起作用。系统首先根据各个表之间的联接条件,把多个表合成一个临时表后,再由where进行过滤,然后再计算,计算完后再由having进行过滤。由此可见,要想过滤条件起到正确的作用,首先要明白这个条件应该在什么时候起作用,然后再决定放在那里
 

JOIN联表中ON,WHERE后面跟条件的区别
对于JOIN的连表操作,这里就不细述了,当我们在对表进行JOIN关联操作时,对于ON和WHERE后面的条件,不清楚大家有没有注意过,有什么区别,可能有的朋友会认为跟在它们后面的条件是一样的,你可以跟在ON后面,如果愿意,也可以跟在WHERE后面。它们在ON和WHERE后面究竟有一个什么样的区别呢?
在JOIN操作里,有几种情况。LEFT JOIN,RIGHT JOIN,INNER JOIN等。

为了清楚的表达主题所描述的问题,我简要的对LEFT,RIGHT,INNER这几种连接方式作一个说明。

下面就拿一个普通的博客系统的日志表(post)和分类表(category)来描述吧。

这里我们规定有的日志可能没有分类,有的分类可能目前没有属于它的文章。

1.    LEFT JOIN:

(保证找出左联表中的所有行)

查出所有文章,并显示出他们的分类:

SELECT p.title,c.category_name FROM post p LEFT JOIN category c ON p.cid = c.cid

2.    RIGHT JOIN:

(保证找出右联表中的所有行)

查询所有的分类,并显示出该分类所含有的文章数。

SELECT COUNT(p.id),c.category_name FROM post p RIGHTJOIN  category c ON p.pid = c.cid

3.    INNER JOIN

(找出两表中关联相等的行)

查询有所属分类的日志。(即那些没有所性分类的日志文章将不要我们的查询范围之内)。

SELECT p.title,c.category_name FROM post p INNER JOIN category c ON p.cid = c.cid.这种情况和直接两表硬关联等价。

现在我们回过头来看上面的问题。

对于第一种情况,如果我们所ON 的条件写在WHERE 后面,将会出现什么情况呢?

即:

SELECT p.title,c.category_name FROM post p LEFT JOIN category c WHERE  p.cid = c.cid对于第二种情况,我们同样按照上面的书写方式。

SELECT COUNT(p.id),c.category_name FROM post p RIGHTJOIN  category c WHERE p.pid = c.cid

如果运行上面的SQL语句,就会发现,它们已经过滤掉了一些不满足条件的记录,可能在这里,大家会产生疑问了,不是用了LEFT和RIGHT吗?它们可以保证左边或者右边的所有行被全部查询出来,为什么现在不管用了呢?对于出现这种的问题,呵呵!是不是觉得有些不可思议。

出现这种的问题,原因就在WHERE和ON这两个关键字后面跟条件。

好了,现在我也不调大家味口了,给大家提示答案吧。

对于JOIN参与的表的关联操作,如果需要不满足连接条件的行也在我们的查询范围内的话,我们就必需把连接条件放在ON后面,而不能放在WHERE 后面,如果我们把连接条件放在了WHERE后面,那么所有的LEFT,RIGHT,等这些操作将不起任何作用,对于这种情况,它的效果就完全等同于 INNER连接。对于那些不影响选择行的条件,放在ON或者WHERE后面就可以。

记住:所有的连接条件都必需要放在ON后面,不然前面的所有LEFT,和RIGHT关联将作为摆设,而不起任何作用。


http://blog.chinaunix.net/uid-9789791-id-1997374.html

<think>嗯,用户问的是Hive SQL中左连接LEFT JOIN)的ON条件WHERE条件区别。我得先回忆一下Hive的处理逻辑。根据之前的引用资料,记得左连接时,ON条件不会过滤左表的数据,无论ON里的条件是否满足,左表的记录都会保留。而WHERE条件是在连接之后应用的,所以会过滤掉不符合条件的行,包括左表中那些在右表没有匹配到的行,这可能导致LEFT JOIN变成类似INNER JOIN的效果。 首先,要明确左连接的基本特性:保留左表所有记录,右表没有匹配的则填充NULL。如果过滤条件放在ON里,比如右表的某个字段,这时候ON里的条件会影响右表的记录是否匹配,但左表的记录依然会被保留。例如,在引用[1]中提到,如果将右表的过滤条件放在WHERE里,会导致LEFT JOIN变成INNER JOIN,因为WHERE会在连接后过滤掉右表为NULL的行,这样左表原本保留的行可能就被排除了。 然后,引用[2][4]都强调了ONWHERE的执行顺序不同。ON条件是在连接过程中应用的,而WHERE是在连接之后。对于左连接来说,ON里的条件只会影响右表是否匹配,不会影响左表的数据保留。而WHERE则会对整个结果集进行过滤,包括左表的记录。如果左表的某个条件放在WHERE里,那么那些不符合条件的左表记录也会被过滤掉,这时候LEFT JOIN的效果可能就不如预期了。 还要考虑到NULL值的问题,如引用[3]提到的,比较运算可能返回NULL,这会影响条件判断。在ON条件中,如果右表的某个字段为NULL,可能会导致条件不满足,但左表的记录依然存在。而WHERE中的条件如果涉及右表字段,会排除那些右表为NULL的行,从而改变结果。 用户可能需要具体的例子来理解,所以最好给出两个对比的示例,比如在ON里过滤右表WHERE里过滤右表的不同结果。同时,还要说明如果对左表使用WHERE条件,会直接过滤左表的数据,这在LEFT JOIN中可能不适用,除非确实需要过滤左表。 总结起来,关键点在于执行顺序过滤的对象:ON影响右表的匹配,WHERE影响整个结果集。需要确保用户明白这两种条件放置位置的不同影响,避免误用导致查询结果不符合预期。</think>### Hive SQL连接LEFT JOIN)中ON条件WHERE条件区别 #### 一、核心区别 在Hive SQL中,`ON`条件与`WHERE`条件的执行顺序语义逻辑有本质差异: 1. **`ON`条件** - 作用于**连接过程**,仅影响**右表记录的匹配逻辑** - 即使条件不满足,**左表记录仍会被保留**(右表字段填充`NULL`) - 例如: ```sql SELECT * FROM a LEFT JOIN b ON a.id = b.id AND b.dt = '2023-01-01' -- 右表过滤条件 ``` 此时右表`b`未匹配的记录会显示为`NULL`,但左表`a`所有记录仍保留[^1][^2][^4]。 2. **`WHERE`条件** - 作用于**连接完成后的结果集**,对所有字段进行过滤 - 会**直接过滤掉不符合条件的记录**(包括左表记录) - 例如: ```sql SELECT * FROM a LEFT JOIN b ON a.id = b.id WHERE b.dt = '2023-01-01' -- 全局过滤条件 ``` 此时左表中未匹配到`b.dt='2023-01-01'`的记录会被过滤,相当于`INNER JOIN`。 #### 二、执行顺序对比 $$ \text{执行顺序:ON条件连接操作 → WHERE条件} $$ - **优先级**:`ON`条件优先级高于`WHERE`条件 - **数据保留**:`WHERE`条件可能导致左表数据丢失,`ON`条件仅影响右表匹配结果[^2] #### 三、典型场景分析 | 场景 | 条件位置 | 左表数据保留 | 右表数据匹配 | 等效操作 | |------|----------|--------------|--------------|----------| | 过滤右表 | `ON` | ✔️ | 仅匹配符合条件的记录 | 标准LEFT JOIN | | 过滤右表 | `WHERE` | ❌ | 过滤掉所有未匹配记录 | INNER JOIN | | 过滤左表 | `ON` | ✔️ | 不影响左表过滤 | 无效操作 | | 过滤左表 | `WHERE` | ❌ | 直接过滤左表记录 | 普通WHERE过滤 | #### 四、NULL值处理 当比较运算涉及`NULL`值时(例如`1 < NULL`),结果为`NULL`,在条件判断中会被视为`FALSE`[^3]。 例如:`WHERE b.col > 10`会排除`b.col IS NULL`的记录。 #### 五、实验验证 ```sql -- 测试数据 CREATE TABLE a (id INT, value STRING); INSERT INTO a VALUES (1,'A'), (2,'B'); CREATE TABLE b (id INT, status STRING); INSERT INTO b VALUES (1,'C'), (2,'D'); -- 场景1:ON条件过滤右表 SELECT * FROM a LEFT JOIN b ON a.id = b.id AND b.status <> 'C'; -- 结果:保留所有左表记录,右表id=1的记录被过滤 -- 场景2:WHERE条件过滤右表 SELECT * FROM a LEFT JOIN b ON a.id = b.id WHERE b.status <> 'C'; -- 结果:仅保留id=2的记录(左表id=1的记录被过滤) ```
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值