1、MVCC多版本并发控制机制
MVCC(Multi-Version Concurrency Control)
:全称为多版本并发控制。是用来保证并发事务的隔离性的。比如Mysql
在可重复读隔离级别下同样的sql
查询语句在一个事务里多次执行查询结果相同,就算其它事务对数据有修改也不会影响当前事务sql
语句的查询结果。
mysql
中对于一行数据的读和写两个操作默认是不会通过加锁互斥来保证隔离性,避免了频繁加锁互斥,而在串行化隔离级别为了保证较高的隔离性是通过将所有操 作加锁互斥来实现的。
Mysql
在读已提交和可重复读隔离级别下都实现了MVCC
机制。
1.1、undo日志版本链与read view机制详解
undo
日志版本链是指一行数据被多个事务依次修改过后,在每个事务修改完后,Mysql
会保留修改前的数据undo
回滚 日志,并且用两个隐藏字段trx_id
和roll_pointer
把这些undo
日志串联起来形成一个历史记录版本链。
trx_id
:事务id
。roll_pointer
:回滚指针。
版本链如下:
在可重复读隔离级别,当事务开启,执行任何查询sql
时会生成当前事务的一致性视图read-view
,该视图在事务结束之前都不会变化,如果是读已提交隔离级别在每次执行查询sql
时都会重新生成。
这个视图由执行查询时所有未提交事务id数组(数组里最小的id为min_id) 和 已创建的最大事务id(max_id) 组成,事务里的任何sql
查询结果需要从对应版本链里的最新数据开始逐条跟read-view
做比对从而得到最终的快照结果。
版本链比对规则:
-
如果
row
的trx_id
落在绿色部分(trx_id<min_id
),表示这个版本是已提交的事务生成的,这个数据是可见的; -
如果
row
的trx_id
落在红色部分(trx_id>max_id
),表示这个版本是由将来启动的事务生成的,是不可见的(若row
的trx_id
就是当前自己的事务是可见的); -
如果
row
的trx_id
落在黄色部分(min_id <=trx_id<= max_id
),那就包括两种情况3.1. 若
row
的trx_id
在视图数组中,表示这个版本是由还没提交的事务生成的,不可见(若row
的trx_id
就是当前自 己的事务是可见的);3.2. 若
row
的trx_id
不在视图数组中,表示这个版本是已经提交了的事务生成的,可见。 对于删除的情况可以认为是update
的特殊情况,会将版本链上最新的数据复制一份,然后将trx_id
修改成删除操作的trx_id
,同时在该条记录的头信息(record header
)里的(deleted_flag
)标记位写上true
,来表示当前记录已经被 删除,在查询时按照上面的规则查到对应的记录如果delete_flag
标记位为true
,意味着记录已被删除,则不返回数据。
注意
:begin/start transaction
命令并不是一个事务的起点,在执行到它们之后的第一个修改操作InnoDB
表的语句, 事务才真正启动,才会向mysql
申请事务id
,mysql
内部是严格按照事务的启动顺序来分配事务id
的。
1.2、原理分析
分析案例如下图:
- 在如图的第8行时,事务A、B、C都已经执行了更新操作,并生成了事务id,其中C已经提交了。
- 事务D在第一次执行查询操作的时候,生成的
Read-View
为[100,200], 300
,未提交事务有[100,200]
,最大已提交事务为300
。 - 因为当前的隔离级别使用的是
R(重复读)
,所以8、12、16行的Read-View
都是一样的,然后根据版本链比对规则
查找的可见的都是同一条数据。然是如果是已提交都的话,16行Read-View
就不一样了,查询时的匹配数据也不一样。
总结: MVCC
机制的实现就是通过read-view
机制与undo
版本链比对机制,使得不同的事务会根据数据版本链对比规则读取同一条数据在版本链上的不同版本数据。
2、BufferPool缓存机制
为什么Mysql不能直接更新磁盘上的数据而且设置这么一套复杂的机制来执行SQL了?
- 因为来一个请求就直接对磁盘文件进行随机读写,然后更新磁盘文件里的数据性能可能相当差。
- 因为磁盘随机读写的性能是非常差的,所以直接更新磁盘文件是不能让数据库抗住很高并发的。
- Mysql这套机制看起来复杂,但它可以保证每个更新请求都是更新内存
BufferPool
,然后顺序写日志文件,同时还能保证各种异常情况下的数据一致性。更新内存的性能是极高的,然后顺序写磁盘上的日志文件的性能也是非常高的,要远高于随机读写磁盘文件。正是通过这套机制,才能让我们的MySQL
数据库在较高配置的机器上每秒可以抗下几干的读写请求。