insert into select 迁移数据,愚蠢的行为

在高并发环境下,使用`insert into select`进行数据迁移时,全表扫描可能导致长时间锁表,引发支付流水丢失问题。在测试环境中未暴露此问题,因缺少模拟真实业务场景。解决方案是为where条件创建索引,避免全表扫描。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

事情的起因

公司的交易量比较大,使用的数据库是mysql,每天的增量差不多在百万左右,公司并没有分库分表,所以想维持这个表的性能只能考虑做数据迁移。

同事李某接到了这个任务,于是他想出了这两个方案

  • 先通过程序查询出来,然后插入历史表,再删除原表

  • 使用insert into select让数据库IO来完成所有操作

第一个方案使用的时候发现一次性全部加载,系统直接就OOM了,但是分批次做就过多io和时间长,于是选用了第二种方案,测试的时候没有任何问题,开开心心上线,然后被开除。

到底发生了啥,我们复盘一下

先来看第一个方案,先看伪代码

// 1、查询对应需要迁移的数据
List<Object> list = selectData();

// 2、将数据插入历史表
insertData(list);

// 3、删除原表数据
deleteByIds(ids);

我们可以从这段代码中看到,OOM的原因很简单,我们直接将数据全部加载内存,内存不爆才怪。

再来看看第二个方案,到底发生了啥。

为了维持表的性能,同时保留有效数据,经过商量定了一个量,保留10天的数据,差不多要在表里面保留1kw的数据。所以同事就做了一个时间筛选的操作,直接insert into select ... dateTime < (Ten days ago),爽极了,直接就避免了要去分页查询数据,这样就不存在OOM啦。还简化了很多的代码操作,减少了网络问题。

为了测试,还特意建了1kw的数据来模拟,测试环境当然是没有问题啦,顺利通过。考虑到这个表是一个支付流水表,于是将这个任务做成定时任务,并且定在晚上8点执行。

晚上量也不是很大,自然是没有什么问题,但是第二天公司财务上班,开始对账,发现资金对不上,很多流水都没有入库。最终排查发现晚上8点之后,陆陆续续开始出现支付流水插入失败的问题,很多数据因此丢失。

最终定位到了是迁移任务引起的问题,刚开始还不明所以,白天没有问题,然后想到晚上出现这样的情况可能是晚上的任务出现了影响,最后停掉该任务的第二次上线,发现没有了这样的情况。

复盘

问题在哪里?

为什么停掉迁移的任务之后就好了呢?这个insert into select操作到底做了什么?我们来看看这个语句的explain。

图片

图片

我们不难从图中看出,这个查询语句直接走了全表扫描。这个时候,我们不难猜想到一点点问题。如果全表扫描,我们这个表这么大,是不是意味着迁移的时间会很长?假若我们这个迁移时间为一个小时,那是不是意味着就解释了我们白天没有出现这样问题的原因了。

但是全表扫描是最根本的原因吗?

我们不妨试试,一边迁移,一边做些的操作,还原现场。最终还是会出现这样的问题。这个时候,我们可以调整一下,大胆假设,如果不全表扫描,是不是就不会出现这样的问题。当我们将条件修改之后,果然发现没有走了全表扫描了。

最终再次还原现场,问题解决了

图片

图片

得出结论:全表扫描导致了这次事故的发生。

这样做就解决了发生的问题,但是做为陆陆续续开始失败这个就不好解释了。

原因

在默认的事务隔离级别下:insert into a select b的操作a表示直接锁表,b表是逐条加锁。这也就解释了为什么出现陆续的失败的原因。在逐条加锁的时候,流水表由于多数是复合记录,所以最终部分在扫描的时候被锁定,部分拿不到锁,最终导致超时或者直接失败,还有一些在这加锁的过成功成功了。

为什么测试没有问题?

在测试的时候充分的使用了正式环境的数据来测试,但是别忽视一个问题,那就是测试环境毕竟是测试环境,在测试的时候,数据量真实并不代表就是真实的业务场景。比方说,这个情况里面就少了一个迁移的时候,大量数据的插入这样的情况。最终导致线上bug

解决办法

既然我们避免全表扫描就可以解决,我们避免它就行了。想要避免全表扫描,对where后面的条件做索引,让我们的select查询都走索引即可。

insert into还能用吗?

可以

总结

使用insert into select的时候请慎重,一定要做好索引。

### SQL 中 `INSERT INTO SELECT` 和 `SELECT INTO FROM` 的区别及用法 #### 插入数据到现有表:`INSERT INTO SELECT` 此语法用于将来自另一个表的数据插入现有的目标表中。这允许基于某些条件筛选源表中的记录并将其复制到目标表。 ```sql -- 将满足特定条件的客户信息从Customer表插入到NewCustomers表 INSERT INTO NewCustomers (FirstName, LastName, City, Country) SELECT FirstName, LastName, City, Country FROM Customer WHERE City = 'Paris' ORDER BY LastName; ``` 上述例子展示了如何利用 `INSERT INTO SELECT` 来实现有条件的数据迁移操作[^1]。 #### 创建新表并插入数据:`SELECT INTO FROM` 相比之下,`SELECT INTO FROM` 不仅会执行相同类型的选取动作,还会自动创建一个新的表格来存储所选的结果集。这意味着不需要预先定义好接收这些行的目标结构;相反,在第一次运行该命令时就会建立相应的架构。 ```sql -- 使用Select Into From创建一个名为Pariser的新表, -- 并从中提取居住在巴黎的所有客户的姓名和国家 SELECT FirstName, LastName, Country INTO Pariser -- 新建表名 FROM Customer WHERE City = 'Paris'; ``` 这种形式对于快速生成临时性的汇总视图或者备份特别有用,因为它简化了流程,无需事先声明模式即可完成整个过程。 需要注意的是,不同数据库管理系统可能对这两种语句的支持程度有所差异,并且具体行为也可能存在细微差别。因此建议查阅相应DBMS的手册获取最准确的信息。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

尘世中-迷途小书童

欢迎IT从业者的头脑风暴

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值