数据库优化的四个方面
数据库优化维度有如下四个:
- 硬件
- 系统配置
- 数据库表结构
- SQL 及索引
优化选择:
- 优化成本:硬件>系统配置>数据库表结构>SQL 及索引。
- 优化效果:硬件<系统配置<数据库表结构
优化工具有啥
数据库层面
检查问题常用的 12 个工具:
- MySQL
- mysqladmin:MySQL 客户端,可进行管理操作
- mysqlshow:功能强大的查看 shell 命令
- SHOW [SESSION | GLOBAL] variables:查看数据库参数信息
- SHOW [SESSION | GLOBAL] STATUS:查看数据库的状态信息
- information_schema:获取元数据的方法
- SHOW ENGINE INNODB STATUS:Innodb 引擎的所有状态
- SHOW PROCESSLIST:查看当前所有连接的 session 状态
- explain:获取查询语句的执行计划
- show index:查看表的索引信息
- slow-log:记录慢查询语句
- mysqldumpslow:分析 slowlog 文件的工具
不常用但好用的 7 个工具:
- Zabbix:监控主机、系统、数据库(部署 Zabbix 监控平台)
- pt-query-digest:分析慢日志
- MySQL slap:分析慢日志
- sysbench:压力测试工具
- MySQL profiling:统计数据库整体状态工具
- Performance Schema:MySQL 性能状态统计的数据
- workbench:管理、备份、监控、分析、优化工具(比较费资源)
关于 Zabbix 参考:http://www.cnblogs.com/clsn/p/7885990.html
数据库层面问题解决思路
一般应急调优的思路:针对突然的业务办理卡顿,无法进行正常的业务处理,需要马上解决的场景。
- show processlist
- explain select id ,name from stu where name='clsn'; # ALL id name age sex
- select id,name from stu where id=2-1 函数 结果集>30;
- show index from table;
- 通过执行计划判断,索引问题(有没有、合不合理)或者语句本身问题
- show status like '%lock%'; # 查询锁状态
- kill SESSION_ID; # 杀掉有问题的session
常规调优思路:针对业务周期性的卡顿,例如在每天 10-11 点业务特别慢,但是还能够使用,过了这段时间就好了。
- 查看slowlog,分析slowlog,分析出查询慢的语句;
- 按照一定优先级,一个一个排查所有慢语句;
- 分析top SQL,进行explain调试,查看语句执行时间;
- 调整索引或语句本身。
系统层面
CPU方面:vmstat、sar top、htop、nmon、mpstat。
内存:free、ps-aux。
IO 设备(磁盘、网络):iostat、ss、netstat、iptraf、iftop、lsof。
vmstat 命令说明:
- Procs:r 显示有多少进程正在等待 CPU 时间。b 显示处于不可中断的休眠的进程数量。在等待 I/O。
- Memory:swpd 显示被交换到磁盘的数据块的数量。未被使用的数据块,用户缓冲数据块,用于操作系统的数据块的数量。
- Swap:操作系统每秒从磁盘上交换到内存和从内存交换到磁盘的数据块的数量。s1 和 s0 ***是 0。
- IO:每秒从设备中读入 b1 的写入到设备 b0 的数据块的数量。反映了磁盘 I/O。
- System:显示了每秒发生中断的数量(in)和上下文交换(cs)的数量。
- CPU:显示用于运行用户代码,系统代码,空闲,等待 I/O 的 CPU 时间。
iostat 命令说明:
- 实例命令:iostat -dk 1 5;iostat -d -k -x 5 (查看设备使用率(%util)和响应时间(await))。
- TPS:该设备每秒的传输次数。“一次传输”意思是“一次 I/O 请求”。多个逻辑请求可能会被合并为“一次 I/O 请求”。
- iops :硬件出厂的时候,厂家定义的一个每秒***的 IO 次数。
- "一次传输"请求的大小是未知的。
- KB_read/s:每秒从设备(drive expressed)读取的数据量。
- KB_wrtn/s:每秒向设备(drive expressed)写入的数据量。
- KB_read:读取的总数据量。
- KB_wrtn:写入的总数量数据量;这些单位都为 Kilobytes。
系统层面问题解决办法
你认为到底负载高好,还是低好呢?在实际的生产中,一般认为 CPU 只要不超过 90% 都没什么问题。当然不排除下面这些特殊情况。
CPU 负载高,IO 负载低:
- 内存不够
- 磁盘性能差
- SQL 问题:去数据库层,进一步排查 SQL 问题
- IO 出问题了(磁盘到临界了、raid 设计不好、raid 降级、锁、在单位时间内 TPS 过高)
- TPS 过高:大量的小数据 IO、大量的全表扫描
IO 负载高,CPU 负载低:
- 大量小的 IO 写操作
- autocommit,产生大量小 IO;IO/PS,磁盘的一个定值,硬件出厂的时候,厂家定义的一个每秒***的 IO 次数。
- 大量大的 IO 写操作:SQL 问题的几率比较大
IO和 CPU 负载都很高:
- 硬件不够了或 SQL 存在问题
基础优化
优化思路
定位问题点吮吸:硬件>系统>应用>数据库>架构(高可用、读写分离、分库分表)。
处理方向:明确优化目标、性能和安全的折中、防患未然。
硬件优化
①主机方面
根据数据库类型,主机 CPU 选择、内存容量选择、磁盘选择:
- 平衡内存和磁盘资源
- 随机的 I/O 和顺序的 I/O
- 主机 RAID 卡的 BBU(Battery Backup Unit)关闭
②CPU 的选择
CPU 的两个关键因素:核数、主频。根据不同的业务类型进行选择:
- CPU 密集型:计算比较多,OLTP 主频很高的 CPU、核数还要多。
- IO 密集型:查询比较,OLAP 核数要多,主频不一定高的。
③内存的选择
OLAP 类型数据库,需要更多内存,和数据获取量级有关。OLTP 类型数据一般内存是 CPU 核心数量的 2 倍到 4 倍,没有***实践。
④存储方面
根据存储数据种类的不同,选择不同的存储设备,配置合理的 RAID 级别(raid5、raid10、热备盘)。
对于操作系统来讲,不需要太特殊的选择,***做好冗余(raid1)(ssd、sas、sata)。
主机 raid 卡选择:
- 实现操作系统磁盘的冗余(raid1)
- 平衡内存和磁盘资源
- 随机的 I/O 和顺序的 I/O
- 主机 raid 卡的 BBU(Battery Backup Unit)要关闭
⑤网络设备方面
使用流量支持更高的网络设备(交换机、路由器、网线、网卡、HBA 卡)。注意:以上这些规划应该在初始设计系统时就应该考虑好。
服务器硬件优化
服务器硬件优化关键点:
- 物理状态灯
- 自带管理设备:远程控制卡(FENCE设备:ipmi ilo idarc)、开关机、硬件监控。
- 第三方的监控软件、设备(snmp、agent)对物理设施进行监控。
- 存储设备:自带的监控平台。EMC2(HP 收购了)、 日立(HDS)、IBM 低端 OEM HDS、高端存储是自己技术,华为存储。
系统优化
CPU:基本不需要调整,在硬件选择方面下功夫即可。
内存:基本不需要调整,在硬件选择方面下功夫即可。
SWAP:MySQL 尽量避免使用 Swap。阿里云的服务器中默认 swap 为 0。
IO :raid、no lvm、ext4 或 xfs、ssd、IO 调度策略。
Swap 调整(不使用 swap 分区):
- /proc/sys/vm/swappiness的内容改成0(临时),/etc/sysctl. conf上添加vm.swappiness=0(***)
这个参数决定了 Linux 是倾向于使用 Swap,还是倾向于释放文件系统 Cache。在内存紧张的情况下,数值越低越倾向于释放文件系统 Cache。
当然,这个参数只能减少使用 Swap 的概率,并不能避免 Linux 使用 Swap。
修改 MySQL 的配置参数 innodb_flush_ method,开启 O_DIRECT 模式。
这种情况下,InnoDB 的 buffer pool 会直接绕过文件系统 Cache 来访问磁盘,但是 redo log 依旧会使用文件系统 Cache。
值得注意的是,Redo log 是覆写模式的,即使使用了文件系统的 Cache,也不会占用太多。
IO 调度策略:
- #echo deadline>/sys/block/sda/queue/scheduler 临时修改为deadline
***修改:
- vi /boot/grub/grub.conf
- 更改到如下内容:
- kernel /boot/vmlinuz-2.6.18-8.el5 ro root=LABEL=/ elevator=deadline rhgb quiet
系统参数调整
Linux 系统内核参数优化:
- vim/etc/sysctl.conf
- net.ipv4.ip_local_port_range = 1024 65535:# 用户端口范围
- net.ipv4.tcp_max_syn_backlog = 4096
- net.ipv4.tcp_fin_timeout = 30
- fs.file-max=65535:# 系统***文件句柄,控制的是能打开文件***数量
用户限制参数(MySQL 可以不设置以下配置):
- vim/etc/security/limits.conf
- * soft nproc 65535
- * hard nproc 65535
- * soft nofile 65535
- * hard nofile 65535
应用优化
业务应用和数据库应用独立。
防火墙:iptables、selinux 等其他无用服务(关闭):
- chkconfig --level 23456 acpid off
- chkconfig --level 23456 anacron off
- chkconfig --level 23456 autofs off
- chkconfig --level 23456 avahi-daemon off
- chkconfig --level 23456 bluetooth off
- chkconfig --level 23456 cups off
- chkconfig --level 23456 firstboot off
- chkconfig --level 23456 haldaemon off
- chkconfig --level 23456 hplip off
- chkconfig --level 23456 ip6tables off
- chkconfig --level 23456 iptables off
- chkconfig --level 23456 isdn off
- chkconfig --level 23456 pcscd off
- chkconfig --level 23456 sendmail off
- chkconfig --level 23456 yum-updatesd off
安装图形界面的服务器不要启动图形界面 runlevel 3。
另外,思考将来我们的业务是否真的需要 MySQL,还是使用其他种类的数据库。用数据库的***境界就是不用数据库。
数据库优化
SQL 优化方向:
- 执行计划
- 索引
- SQL 改写
架构优化方向:
- 高可用架构
- 高性能架构
- 分库分表
数据库参数优化
①调整
实例整体(高级优化,扩展):
- thread_concurrency:# 并发线程数量个数
- sort_buffer_size:# 排序缓存
- read_buffer_size:# 顺序读取缓存
- read_rnd_buffer_size:# 随机读取缓存
- key_buffer_size:# 索引缓存
- thread_cache_size:# (1G—>8, 2G—>16, 3G—>32, >3G—>64)
②连接层(基础优化)
设置合理的连接客户和连接方式:
- max_connections # ***连接数,看交易笔数设置
- max_connect_errors # ***错误连接数,能大则大
- connect_timeout # 连接超时
- max_user_connections # ***用户连接数
- skip-name-resolve # 跳过域名解析
- wait_timeout # 等待超时
- back_log # 可以在堆栈中的连接数量
③SQL 层(基础优化)
query_cache_size: 查询缓存 >>> OLAP 类型数据库,需要重点加大此内存缓存,但是一般不会超过 GB。
对于经常被修改的数据,缓存会马上失效。我们可以使用内存数据库(redis、memecache),替代它的功能。
存储引擎层优化
innodb 基础优化参数:
- default-storage-engine
- innodb_buffer_pool_size # 没有固定大小,50%测试值,看看情况再微调。但是尽量设置不要超过物理内存70%
- innodb_file_per_table=(1,0)
- innodb_flush_log_at_trx_commit=(0,1,2) # 1是最安全的,0是性能***,2折中
- binlog_sync
- Innodb_flush_method=(O_DIRECT, fdatasync)
- innodb_log_buffer_size # 100M以下
- innodb_log_file_size # 100M 以下
- innodb_log_files_in_group # 5个成员以下,一般2-3个够用(iblogfile0-N)
- innodb_max_dirty_pages_pct # 达到百分之75的时候刷写 内存脏页到磁盘。
- log_bin
- max_binlog_cache_size # 可以不设置
- max_binlog_size # 可以不设置
- innodb_additional_mem_pool_size #小于2G内存的机器,推荐值是20M。32G内存以上100M
参考文章:
https://www.cnblogs.com/zishengY/p/6892345.html
https://www.jianshu.com/p/d7665192aaaf