【MySQL】删除重复记录保留一条的高性能DELETE写法

本文主要是介绍【MySQL】删除重复记录保留一条的高性能DELETE写法,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!


     周中遇到一个情况就是一张表出现了很多重复记录,需要删除掉这些重复记录只保留一条,因为有自增长的主键,就决定保留PK最小的那一条吧。具体操作过程记录如下。


     建一张示例表并插些数据看看吧。

         mysql> CREATE TABLE `visitor_province_yn` (
          ->   `id` INT(11) NOT NULL AUTO_INCREMENT,
          ->   `visitor` int(10) unsigned NOT NULL,
          ->   `province` varchar(25) NOT NULL,
          ->   `yn` CHAR(1) NOT NULL,
          ->   PRIMARY KEY (`id`)
          -> );
         Query OK, 0 rows affected (0.01 sec)

         mysql> INSERT INTO `visitor_province_yn`(`visitor`, `province`, `yn`) VALUES
          -> (11, 'A省', 'Y'),
          -> (11, 'A省', 'Y'),
          -> (11, 'A省', 'Y'),
          -> (22, 'B省', 'N'),
          -> (22, 'B省', 'N'),
          -> (22, 'B省', 'N'),
          -> (33, 'C省', 'Y'),
          -> (33, 'C省', 'Y'),
          -> (33, 'C省', 'Y');
         Query OK, 9 rows affected (0.00 sec)
         Records: 9  Duplicates: 0  Warnings: 0

     示例表“visitor_province_yn”表的数据如下,按照预想是删除重复保留“id”是1、4以及7这三条记录。

mysql> SELECT * FROM `visitor_province_yn`;
+----+---------+----------+----+
| id | visitor | province | yn |
+----+---------+----------+----+
|  1 |      11 | A省      | Y  |
|  2 |      11 | A省      | Y  |
|  3 |      11 | A省      | Y  |
|  4 |      22 | B省      | N  |
|  5 |      22 | B省      | N  |
|  6 |      22 | B省      | N  |
|  7 |      33 | C省      | Y  |
|  8 |      33 | C省      | Y  |
|  9 |      33 | C省      | Y  |
+----+---------+----------+----+
9 rows in set (0.00 sec)

     首先想到的是以下写法,因为DML和DQL是同一张表,不得不额外多一层嵌套子查询。所以,觉得这种写法简单明晰,但是性能应该要有所折扣。

DELETE FROM visitor_province_ynWHERE id NOT IN(SELECT idFROM(SELECT MIN(vpy.id) AS idFROM visitor_province_yn AS vpyGROUP BY vpy.visitor, vpy.province, vpy.yn) AS tmp);

     于是,又去查询了一下MySQL官方手册有关“DELETE”语法的解释(http://dev.mysql.com/doc/refman/5.7/en/delete.html),结果一眼就找到了当前需要的另一种写法,在文档的“Multi-Table Deletes”部分,形式如下。


         DELETE t1 FROM t1 LEFT JOIN t2 ON t1.id=t2.id WHERE t2.id IS NULL;


     以此为参考,改写后的SQL如下所示。

DELETE visitor_province_yn
FROM visitor_province_yn
LEFT JOIN(SELECT MIN(vpy.id) AS idFROM visitor_province_yn AS vpyGROUP BY vpy.visitor, vpy.province, vpy.yn) AS tmp USING (id)
WHERE tmp.id IS NULL;

     因此,原来这种左连接返回存在于左表中而不存在于右表中记录的写法同样适用于“DELETE”。“EXPLAIN”一下发现,第二种写法以“PRIMARY”的查询方式代替第一种写法的“DEPENDENT SUBQUERY”,扫描更少的记录行,而且关联方式“type”是性能更优的“ref”(参考译文:http://blog.csdn.net/sweeper_freedoman/article/details/52819839)。由此可见,第二种写法更值得选择。




这篇关于【MySQL】删除重复记录保留一条的高性能DELETE写法的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/760365

相关文章

MySQL的JDBC编程详解

《MySQL的JDBC编程详解》:本文主要介绍MySQL的JDBC编程,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录前言一、前置知识1. 引入依赖2. 认识 url二、JDBC 操作流程1. JDBC 的写操作2. JDBC 的读操作总结前言本文介绍了mysq

java.sql.SQLTransientConnectionException连接超时异常原因及解决方案

《java.sql.SQLTransientConnectionException连接超时异常原因及解决方案》:本文主要介绍java.sql.SQLTransientConnectionExcep... 目录一、引言二、异常信息分析三、可能的原因3.1 连接池配置不合理3.2 数据库负载过高3.3 连接泄漏

Linux下MySQL数据库定时备份脚本与Crontab配置教学

《Linux下MySQL数据库定时备份脚本与Crontab配置教学》在生产环境中,数据库是核心资产之一,定期备份数据库可以有效防止意外数据丢失,本文将分享一份MySQL定时备份脚本,并讲解如何通过cr... 目录备份脚本详解脚本功能说明授权与可执行权限使用 Crontab 定时执行编辑 Crontab添加定

Python实现批量CSV转Excel的高性能处理方案

《Python实现批量CSV转Excel的高性能处理方案》在日常办公中,我们经常需要将CSV格式的数据转换为Excel文件,本文将介绍一个基于Python的高性能解决方案,感兴趣的小伙伴可以跟随小编一... 目录一、场景需求二、技术方案三、核心代码四、批量处理方案五、性能优化六、使用示例完整代码七、小结一、

MySQL中On duplicate key update的实现示例

《MySQL中Onduplicatekeyupdate的实现示例》ONDUPLICATEKEYUPDATE是一种MySQL的语法,它在插入新数据时,如果遇到唯一键冲突,则会执行更新操作,而不是抛... 目录1/ ON DUPLICATE KEY UPDATE的简介2/ ON DUPLICATE KEY UP

MySQL分库分表的实践示例

《MySQL分库分表的实践示例》MySQL分库分表适用于数据量大或并发压力高的场景,核心技术包括水平/垂直分片和分库,需应对分布式事务、跨库查询等挑战,通过中间件和解决方案实现,最佳实践为合理策略、备... 目录一、分库分表的触发条件1.1 数据量阈值1.2 并发压力二、分库分表的核心技术模块2.1 水平分

Python与MySQL实现数据库实时同步的详细步骤

《Python与MySQL实现数据库实时同步的详细步骤》在日常开发中,数据同步是一项常见的需求,本篇文章将使用Python和MySQL来实现数据库实时同步,我们将围绕数据变更捕获、数据处理和数据写入这... 目录前言摘要概述:数据同步方案1. 基本思路2. mysql Binlog 简介实现步骤与代码示例1

C# LiteDB处理时间序列数据的高性能解决方案

《C#LiteDB处理时间序列数据的高性能解决方案》LiteDB作为.NET生态下的轻量级嵌入式NoSQL数据库,一直是时间序列处理的优选方案,本文将为大家大家简单介绍一下LiteDB处理时间序列数... 目录为什么选择LiteDB处理时间序列数据第一章:LiteDB时间序列数据模型设计1.1 核心设计原则

使用shardingsphere实现mysql数据库分片方式

《使用shardingsphere实现mysql数据库分片方式》本文介绍如何使用ShardingSphere-JDBC在SpringBoot中实现MySQL水平分库,涵盖分片策略、路由算法及零侵入配置... 目录一、ShardingSphere 简介1.1 对比1.2 核心概念1.3 Sharding-Sp

MySQL 表空却 ibd 文件过大的问题及解决方法

《MySQL表空却ibd文件过大的问题及解决方法》本文给大家介绍MySQL表空却ibd文件过大的问题及解决方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考... 目录一、问题背景:表空却 “吃满” 磁盘的怪事二、问题复现:一步步编程还原异常场景1. 准备测试源表与数据