机器监控核心指标
| 指标 | 这个指标是什么 | 主要监控场景 | 可以提前发现的问题 |
|---|---|---|---|
| CPU使用率 > 80% | CPU处理计算任务的繁忙程度。超过80%表示剩余计算能力不足20% | 应用计算、请求处理、数据计算 | 请求排队、响应变慢、任务积压、服务超时 |
| RSS内存使用率 > 80% | RSS 全称是 Resident Set Size 即“常驻内存集”,表示进程或容器当前实际占用的物理内存,包括堆内存、线程栈和部分堆外内存等,通常不包括已转移到Swap中的内存 | 应用、容器和进程的实际内存使用情况 | 内存泄漏、频繁GC、容器或进程被OOM杀死 |
| Swap使用率 > 80% | Swap是磁盘上的备用内存。物理内存不足时,系统会将暂时不用的数据放入Swap | 物理内存不足或内存压力较大的机器 | 频繁内存换页、系统变慢、内存耗尽和OOM |
| 系统负载 > 3 | 正在使用CPU、等待CPU或等待磁盘I/O的任务平均数量超过4 | 判断系统整体是否繁忙 | CPU任务排队、磁盘阻塞、系统卡顿 |
| 磁盘繁忙率 > 10% | 磁盘正在处理读写请求的时间占比超过10%,不是磁盘空间使用率 | 数据库、日志、文件读写、备份任务 | 磁盘I/O瓶颈、读写变慢、接口响应延迟 |
| TCP连接数 > 3000,持续3分钟 | TCP连接是客户端与服务器之间的网络通信通道,包括浏览器访问服务器、服务之间调用、应用连接数据库等。连接数不等于用户数 | 服务的并发连接情况 | 连接堆积、连接未释放、文件描述符耗尽、新连接失败 |
| TCP重传数升高 | TCP数据没有成功送达或没有及时收到确认时,系统重新发送数据的次数 | 浏览器与服务器、服务器与服务器之间的网络通信质量 | 网络丢包、网络拥塞、请求变慢和超时 |
| 网络流入速率 > 50 MB/s | 机器每秒接收到的数据超过50 MB,相当于约400 Mbps | 文件上传、数据同步、接口请求、消息消费 | 入站带宽占满、异常流量、网络拥塞 |
| 网络流出速率 > 50 MB/s | 机器每秒发送出去的数据超过50 MB,相当于约400 Mbps | 文件下载、接口响应、日志发送、数据同步 | 出口带宽占满、异常下载或数据传输 |
| 时间偏移 > 1000 ms | 机器时间与标准时间源相差超过1秒 | 服务器时间同步 | 日志时间错乱、认证失败、定时任务异常、分布式系统数据错序 |

425

被折叠的 条评论
为什么被折叠?



