MySQL案例--磁盘空间不足&MTS Group recovery失败

-------------------------------------------------------------------------------------------------正文---------------------------------------------------------------------------------------------------------------
线上业务,最后一次内测阶段;
背景:MySQL-5.7.12
问题发生的现象:
收到报警信息,业务主库A的心跳检测失败,将备库B升级为业务主库;
问题发生的原因:
业务主库A的数据文件目录的磁盘空间剩余量为0%;
问题解决的过程:
磁盘空间写满以后,DML语句无法将数据变更落盘,因此导致业务主库不可用;
所以处理方式也很简单,清理一部分空间以后,purge掉了一些已经备份过的binlog
不过在处理中发现一个问题,replication slave在报错;
查看mysql的error-log,可以看到如下信息:

与此同时,不管是start slave还是change master都无法完成,会在error-log中不断的刷新类似的错误信息;

由于业务主库A降级是在磁盘空间写满以后,所以可以确认备库B上的业务操作不可能会在A上面执行,两个库之间不会有一致性的问题;
于是选择了reset slave all+change master的方式,重新恢复了同步;

故障报告写完以后,再详细研究一下这种现象的原因:
找到一个bug记录:发生于MySQL-5.6
http://bugs.mysql.com/bug.php?id=77496
并且在5.7.12中也发现过:
https://bugs.mysql.com/bug.php?id=80102

在comment中,提到了relay_log_recovery=ON和slave-parallel-type=LOGICAL_CLOCK时会出现这个问题;
恰好正在出问题的库也是这种设置;

发生错误的原因:
基于在5.6的Group Commit特性,5.7中实现了Mutil-Thread-Slave的特性,多个线程会同时复现relay-log中, 同一组的事务;
因此multi-threaded replication slave在运行过程中,如果意外的停止了,由于无法确认事务的一致性,在开启了relay_log_recovery的情况下,会出现如截图中的信息;

官方推荐的恢复步骤:
1.设置relay_log_recovery=0;
2.启动slave的时候,带上特殊命令:START SLAVE UNTIL SQL_AFTER_MTS_GAPS;
3.设置relay_log_recovery=1;
非常重要的一点:relay_log_recovery不是一个动态的参数,需要重启数据库实例;

这个问题在5.7.13得到了修复,整个操作步骤会在重启的时候自动进行;重启的时候...重启的...重启...

虽然和bug文档以及官方描述的场景不同,不过上文中出现的情况应该是同一个原因造成的;
好在能够确认A库上的multi-threaded replication slave不可能出现事务不一致的情况,所以就简单粗暴的清除了slave的信息,然后重新进行了同步;

PS:GTID大法好~

时间: 2024-08-01 07:07:37

MySQL案例--磁盘空间不足&MTS Group recovery失败的相关文章

磁盘空间不足导致mysql无法启动的mysql错误

在mysql中查看表提示1030错误: mysql> desc user; ERROR 1030 (HY000): Got error 28 from storage engine 引起这个错误的原因是磁盘空间不足,导致mysql的临时目录空间tmpdir不够. 解决方法是清空linux系统的/tmp目录,或者修改my.cnf中的tmpdir参数,指向具有足够空间的目录. 使用df 查看分区使用情况: [root@jsunsa tmp]# df /tmp Filesystem          

Mysql存储引擎MyISAM的常见问题(表损坏、无法访问、磁盘空间不足)_Mysql

本文为大家分享了解决Mysql存储引擎MyISAM常见问题的方法,供大家参考,具体内容如下 一.处理MyISAM存储引擎的表损坏 在使用MySQL,可能会遇到过MyISAM存储引擎的表损坏的情况.如以下情况: .frm被锁定不能修改 找不到.myi文件(索引文件) 意外结束记录 文件被毁坏 从表处理器得到错误nnn 解决办法1: 使用MySQL自带的myisamchk工具进行修复 打开bin目录,可以看到该工具   命令如下 myisamchk -r tablename r代表recover 或

FAQ系列 | 磁盘空间满了之后MySQL会怎样

导读 当磁盘空间爆满后,MySQL会发生什么事呢?又应该怎么应对? 会发生什么事 当磁盘空间写满了之后,MySQL是无法再写入任何数据的,包括对表数据的写入,以及binlog.binlog-index等文件.当然了,因为InnoDB是可以把脏数据先放在内存里,所以不会立刻表现出来无法写入,除非开启了binlog,写入请求才会被阻塞. 当MySQL检测到磁盘空间满了,它会: 每分钟:检查空间是否得到释放,以便写入新数据.当发现有剩余空间了,就会继续写入数据,一切照旧.每十分钟:如果还是发现没剩余空

mysql ibdata1文件太大,沾满磁盘空间,再有数据往里写的时候怎么处理。?菜鸟求解决!

问题描述 mysql ibdata1文件太大,沾满磁盘空间,再有数据往里写的时候怎么处理.?菜鸟求解决! 前两天遇到mysql ibdata1文件太大,沾满磁盘空间的问题,本人是卸载然后停服务器,再删除那几个文件的处理.如果项目上线,出现这种情况,再有数据往里写的时候怎么处理.?菜鸟求解决!

Mysql InnoDB删除数据后释放磁盘空间的方法_Mysql

Innodb数据库对于已经删除的数据只是标记为删除,并不真正释放所占用的磁盘空间,这就导致InnoDB数据库文件不断增长. 如果在创建数据库的时候设置innodb_file_per_table=1,这样InnoDB会对每个表创建一个数据文件,然后只需要运行OPTIMIZE TABLE 命令就可以释放所有已经删除的磁盘空间. 运行OPTIMIZE TABLE 表名后,虽然最后会报Table does not support optimize, doing recreate + analyze in

MySQL中查询所有数据库占用磁盘空间大小和单个库中所有表的大小的sql语句_Mysql

查询所有数据库占用磁盘空间大小的SQL语句: 复制代码 代码如下: select TABLE_SCHEMA, concat(truncate(sum(data_length)/1024/1024,2),' MB') as data_size,concat(truncate(sum(index_length)/1024/1024,2),'MB') as index_sizefrom information_schema.tablesgroup by TABLE_SCHEMAorder by dat

MySQL · 最佳实践 · 空间优化

在前三期介绍了RDS for MySQL参数优化,锁问题以及延迟优化最佳实践之后,本期将介绍存储空间相关的最佳实践. 存储空间是RDS很重要的一个指标,在RDS的工单问题中,空间问题的咨询可以排在top 5,当RDS的实际使用空间超过了购买的空间后,实例就会被锁定了,这样就会导致应用无法再写入,更新数据,造成应用的报错.在RDS的控制台中可以设定空间的报警阀值,当实例空间到达报警阀值后用户就会收到报警短信, 这个时候用户则需要对判断当前的空间增长是否合理. 如果增长合理则需要对实例的进行弹性升级

ORA-00257错误:归档日志所在磁盘空间使用100%出错解决

现象: 正在进行DML操作时,操作一直无法完成.退出SQLPLUS时一直无响应--卡着不动无法正常退出. 登陆数据库所在主机,使用SQLPLUS登陆DBA用户时,提示归档出错. [oracle@oel-01 ~]$ sqlplus bys/bys SQL*Plus: Release 11.2.0.1.0 Production on Sun Jul 21 17:55:09 2013 Copyright (c) 1982, 2009, Oracle.  All rights reserved. ER

mysql案例:mysql5.6.14配置my.cnf多实例

mysql案例:mysql5.6.14配置my.cnf多实例,mysql_install_db初始化不读取my.cnf配置文件 1.1.1. mysql5.6.14多实例my.cnf时,初始化不读取my.cnf配置文件 [环境描述] 在多实例配置的/etc/my.cnf环境中,执行mysql_install_db后,启动Mysql报错. [操作步骤] /etc/my.cnf配置文件: [mysqld3307] innodb_data_file_path =ibdata1:1G:autoexten