删除MySQL重复数据

项目背景

在最近做的一个linux性能采集项目中，发现线程的程序入库很慢，再仔细定位，发现数据库里面很多冗余数据。因为在采集中，对于同一台设备，同一个时间点应该只有一个数据，然而，数据库中存入了多个数据。对于如何造成了这个结果，一时没有想清楚，但为了解决入库慢的问题，首先要删除冗余数据。

问题描述

数据库的表结构很简单，如下：

+----------------+--------------+------+-----+---------+-------+
| Field          | Type         | Null | Key | Default | Extra |
+----------------+--------------+------+-----+---------+-------+
| id             | varchar(255) | NO   | PRI | NULL    |       |
| conf_id        | varchar(255) | NO   | MUL | NULL    |       |
| insert_time    | datetime     | YES  |     | NULL    |       |
| cpu_usage      | float(11,2)  | YES  |     | NULL    |       |
| memory_usage   | float(11,2)  | YES  |     | NULL    |       |
| io_usage_write | float(11,2)  | YES  |     | NULL    |       |
| io_usage_read  | float(11,2)  | YES  |     | NULL    |       |
+----------------+--------------+------+-----+---------+-------+

查询所有数据量

select count(*) from perf_linux;

输出 427366

查询所有时间点不同设备的数据量

select count(distinct conf_id, insert_time) from perf_linux ;

输出42387

由上面的数据可以看出，数据冗余了10倍左右。

再按时间分组看一下:

select id, conf_id ,insert_time from perf_linux order by insert_time, conf_id;

输出：

| 2a79f7cd-43a9-4c7b-adb2-316b6c04283e | 1       | 2014-12-09 15:09:14 |
| 50d6f6c2-9c8b-45fd-98fd-2be211221cfd | 1       | 2014-12-09 15:09:14 |
| 740b52e1-e868-4074-ba36-74e2634401b3 | 1       | 2014-12-09 15:09:14 |
| 8b0096a4-9e85-417b-a131-e3505ca79a9c | 1       | 2014-12-09 15:09:14 |
| 90a9e882-5220-4508-a56f-8d4ab4a7929b | 1       | 2014-12-09 15:09:14 |
| d17403ed-24a4-45e8-b51b-2a95118383d9 | 1       | 2014-12-09 15:09:14 |
| 0c2da917-579b-4080-857d-7159f38b44ac | 2       | 2014-12-09 15:09:14 |
| 263083eb-8f63-4d2b-a03f-3320aa678735 | 2       | 2014-12-09 15:09:14 |
| d6c57a38-080b-465a-a55a-beafd9daf32d | 2       | 2014-12-09 15:09:14 |
| f672227b-1fb8-4b85-880d-2cc34b02880d | 2       | 2014-12-09 15:09:14 |
| f80020fe-6cb5-48ec-beb0-4e8ebeb0ca57 | 2       | 2014-12-09 15:09:14 |
| ff633a35-824d-49ba-b78c-5bcc5df8d1cc | 2       | 2014-12-09 15:09:14 |
| 5c41e48a-abfc-4108-a00e-ca7def7d5a5a | 3       | 2014-12-09 15:09:14 |
| 60b7ab9e-c91a-4020-a6d3-7bceb1dc47c5 | 3       | 2014-12-09 15:09:14 |
| 7b6cd2b8-ac6d-43eb-8858-e15885e676c8 | 3       | 2014-12-09 15:09:14 |
| d53a3df5-08c4-4604-8fac-cb51077935f6 | 3       | 2014-12-09 15:09:14 |
| d9e4ba14-f98d-42a8-b3bc-2879d58aa797 | 3       | 2014-12-09 15:09:14 |
| f56f82f6-32a7-47f7-ae07-b13168743884 | 3       | 2014-12-09 15:09:14 |
| 076c4c1b-0028-4a9c-a8c4-de655bd6ab6b | 4       | 2014-12-09 15:09:14 |
| 2a90ad9e-11a5-4707-95e8-78491da658ad | 4       | 2014-12-09 15:09:14 |
| 3b17ad1d-e589-4b65-93a7-d61fc99b4071 | 4       | 2014-12-09 15:09:14 |
| 6988d6cf-44ef-47f7-808d-09791caf2d90 | 4       | 2014-12-09 15:09:14 |
| 8404d281-f9e5-4153-a47e-128c05386758 | 4       | 2014-12-09 15:09:14 |
| e042e310-7ff2-4e4d-8c98-71e3e4d57828 | 4       | 2014-12-09 15:09:14 |
+--------------------------------------+---------+---------------------+

由上图可见，同一个时间点的同一个设备的数据有冗余，现在我们要把这些冗余数据去掉。

解决方法

思路是这样的：首先应该按照conf_id和时间点来判断，进行分组（group by）查询，每组中再取一个就可以。分组是很简单，但是分组怎么取一个呢？我采用了中间表的形式。

创建中间表，并把数据导入中间表

create table perf_linux_t like perf_linux;

insert into perf_linux_t select * from perf_linux;

在中间表中增加一个字段，此字段是自增长的。

ALTER TABLE `perf_linux_t`
ADD COLUMN `auto_id` INT NOT NULL AUTO_INCREMENT ,
DROP PRIMARY KEY,
ADD PRIMARY KEY (`auto_id`);

删除无用数据

先查询一下

select min(auto_id) as auto_id from perf_linux_t group by insert_time ;

删除不对的数据

delete  from perf_linux_t where auto_id not in (select min(auto_id) as auto_id from perf_linux_t group by insert_time);

慢着，输出错误：

You can't specify target table 'perf_linux_t' for update in FROM clause

不能删除啊，那只能再建一个中间表了。

再建中间表

create table tmp like perf_linux_t;

转变思路，不删除不符合的数据，而是把符合的数据存到这张新表中。

insert into tmp select * from perf_linux_t where auto_id in (select min(auto_id) as auto_id from perf_linux_t group by insert_time,conf_id );

把这张表中的无用列删除

ALTER TABLE `tmp`
DROP COLUMN `auto_id`,
DROP PRIMARY KEY;

导回数据

删除原来的数据

truncate table perf_linux;

插入数据

insert into perf_linux select * from tmp;

删除中间表

drop table tmp;

drop table perf_linux_t;

总结

通过这个方法，数据变为了42387条，删除了冗余的数据。但实际上程序的问题并没有完全定位，还需要观察才能定位问题。

而且我觉得我这个方法应该算比较土的方法，如果各位有更好的方式，希望不吝赐教。

参考：

mysql删除重复记录语句的方法

时间： 2024-09-19 13:21:16

删除MySQL重复数据的相关文章

删除MySQL重复数据的方法_Mysql

本文实例讲述了删除MySQL重复数据的方法.分享给大家供大家参考.具体方法如下: 项目背景在最近做的一个linux性能采集项目中,发现线程的程序入库很慢,再仔细定位,发现数据库里面很多冗余数据.因为在采集中,对于同一台设备,同一个时间点应该只有一个数据,然而,数据库中存入了多个数据.对于如何造成了这个结果,一时没有想清楚,但为了解决入库慢的问题,首先要删除冗余数据. 问题描述数据库的表结构很简单,如下: 复制代码代码如下: +----------------+--------------+

Python增量循环删除MySQL表数据的方法_python

需求场景: 有一业务数据库,使用MySQL 5.5版本,每天会写入大量数据,需要不定期将多表中"指定时期前"的数据进行删除,在SQL SERVER中很容易实现,写几个WHILE循环就搞定,虽然MySQL中也存在类似功能,怎奈自己不精通,于是采用Python来实现话不多少,上脚本: # coding: utf-8 import MySQLdb import time # delete config DELETE_DATETIME = '2016-08-31 23:59:59' DELE

Python增量循环删除MySQL表数据的例子

快速删除Excel重复数据的方法

1.我先打开我工作中的一个excel工作表,如下图所示我们会看到表的第2行和第7行,第3行和第6行内容完全相同: 2.选中表中的所有记录,包括A与B标题了,要不之后会看不到标题了. 3.选中之后我们点击菜单栏上的"数据"菜单→"筛选→高级筛选" 如下图所示. 4.在弹出的高级筛选对话框中我们选中"将筛选结果复制到其他位置"一项,然后接着点击"复制到"选择框后面的范围按钮来选择一块区域以存放筛选后的数据 ,记住不要与原数据

MySQL处理重复数据的方法_Mysql

有些 MySQL 数据表中可能存在重复的记录,有些情况我们允许重复数据的存在,但有时候我们也需要删除这些重复的数据. 本章节我们将为大家介绍如何防止数据表出现重复数据及如何删除数据表中的重复数据.防止表中出现重复数据你可以在MySQL数据表中设置指定的字段为 PRIMARY KEY(主键) 或者 UNIQUE(唯一) 索引来保证数据的唯一性. 让我们尝试一个实例:下表中无索引及主键,所以该表允许出现多条重复记录. CREATE TABLE person_tbl ( first_name CHA

在Oracle中如何删除表中设计重复数据

oracle|设计|数据|重复我们可能会出现这种情况,某个表原来设计不周全,导致表里面的数据数据重复,那么,如何对重复的数据进行删除呢? 重复的数据可能有这样两种情况,第一种时表中只有某些字段一样,第二种是两行记录完全一样. 一.对于部分字段重复数据的删除先来谈谈如何查询重复的数据吧. 下面语句可以查询出那些数据是重复的: select 字段1,字段2,count(*) from 表名 group by 字段1,字段2 having count(*) > 1 将上面的>号改为=号就可以查询

基于重复数据删除的虚拟桌面存储优化技术

近年来,云计算已成为分布式计算领域中的研究热点,它是指运行在数据中心软硬件上的应用通过Internet为用户按需提供服务:并将数据中心内的软硬件资源统称为云,云计算自身并不是一种新技术,而是一种新服务模式.这种模式能够将设备安装和资源管理外包给云服务商,具有按使用计费和扩展灵活的特性,通过对IT资源的统一部署与集中管理,云计算能够优化资源的利用率,为用户提供廉价.高效.可靠的服务. 虚拟桌面作为一种典型的云计算应用,是建立在服务器虚拟化基础上的云应用.如图1所示,虚拟桌面基础架构在云中为用户提供

为什么重复数据删除对于云存储而言如此重要？

[51CTO.com快译]大多数人认为云存储服务较实体存储更便宜.毕竟大家可以根据性能与访问需求以每TB每年276美元甚至更低的价格租用存储资源.相比之下,企业数据仓库的每TB每年使用成本一般在2500美元到4000美元之间. 然而除了一级数据之外,大家还需要在云环境下对数据进行备份或者副本保存,这无疑会令资源使用支出大幅提升.设想一下,若企业需要以三年为周期每月保留100 TB备份数据,则其原始备份数据约等于3.6 PB,每月支出将超过83000美元.而且这还不算数据访问以及检索带来的成本.

Mysql中查找并删除重复数据的方法

(一)单个字段 1.查找表中多余的重复记录,根据(question_title)字段来判断代码如下 select * from questions where question_title in (select question_title from peoplegroup by question_title having count(question_title) > 1) 2.删除表中多余的重复记录,根据(question_title)字段来判断,只留有一个记录代码如下