服务器日常巡检该查什么:硬件资源与系统日志全流程
服务器巡检是运维工作中最基础也最容易被忽略的环节。很多团队习惯了等告警响了再冲上去救火,殊不知主动巡检能拦截百分之八十以上的潜在故障。但巡检不是随便看几眼就算完,每项检查必须有明确标准和可落地的操作流程。
硬件健康状况检查
登录服务器后第一件事就是检查硬件状态。硬盘指示灯是否有黄色或红色异常,RAID阵列的磁盘状态是否全部显示Online。用megacli或storcli命令查看阵列卡日志,重点关注Predictive Failure预警,一旦出现就意味着硬盘随时可能离线。内存方面检查是否有ECC校验错误,这类硬件级别的报错虽然不影响当前运行,但积累到一定程度就会触发系统宕机。电源模块状态也要确认,双电源配置下如果坏了一个不及时发现,下次维护时可能造成单点故障。
CPU与内存资源监控
CPU方面不仅看使用率百分比,更要关注load average负载值。正常情况下一分钟负载不应超过CPU核心数的百分之七十。使用top或htop按CPU占用排序,确认是哪个进程消耗了最多资源。内存检查要覆盖总量、已用量和swap交换分区的占用比例,swap使用率超过百分之三十说明物理内存已经吃紧。同时留意内存的buffer和cache占比,过高的cached空间虽然会被系统自动回收,但如果伴随大量page fault则说明内存确实不够用。
磁盘空间与I/O性能分析
磁盘巡检有两个关键维度:空间容量和I/O性能。df命令看各分区使用百分比,建议阈值设百分之八十就列入关注,百分之九十以上需要尽快处理。du逐级查看各目录空间占用,重点排查应用日志、数据库数据和临时文件目录。同时用iostat或dstat查看磁盘I/O情况,await指标如果长期超过二十毫秒就需要排查是否存在读写瓶颈。inode检查同样不能遗漏,使用df -i命令查看,inode用尽时磁盘明明有空间却写不了任何文件。
网络状态与服务端口检查
网络巡检包括带宽使用率、连接数和丢包率三个核心指标。使用netstat或ss统计当前TCP连接总量和TIME_WAIT数量,异常大量的TIME_WAIT连接说明可能有端口耗尽风险。监听端口列表需要和业务文档逐项核对,多出来的端口可能是暗藏的后门程序。ping网关延迟和路由跳数能帮助判断上游网络质量,结合mtr工具可以持续监控整条链路的丢包和延迟变化。
系统日志审查与时间同步
系统日志中Error和Warning级别记录需要每天翻阅。重点关注dmesg中的硬件报错和系统日志中的服务异常记录。时间同步虽然不起眼但非常重要,ntp或chronyd如果出现偏差,会导致证书验证失败、日志排序混乱、定时任务执行异常等连锁问题。应用层面需要检查业务高峰期日志中是否有超时或连接失败的堆栈信息,很多故障在用户投诉之前日志里已经有了明确提示。巡检完成后填写标准化表格,把检查结果和处理备注记录归档,这既是责任落实也是后续故障追溯的宝贵依据。