核心思路:先恢复业务,后定位根因;先止损,后复盘,遵循「告警接收→故障确认→应急止损→定位排查→修复验证→事后复盘」闭环,避免故障扩大。
一、故障发生第一时间:5 分钟应急动作
确认故障真实性,区分范围
确认是个别终端、局部网段,还是全业务、核心链路故障;区分是内网、互联网、VPN、专线哪一块出问题。
核对监控平台:交换机、路由器、防火墙、负载均衡、链路带宽、端口状态、丢包、时延、设备 CPU / 内存。
同步业务侧:业务是否报错,用户反馈规模,是否影响对外业务、生产系统。
快速上报,建立故障沟通群
明确故障等级:P0(全业务中断)、P1(核心业务受损)、P2(局部异常);按公司预案通知领导、业务、运营商、供应商。
对外口径统一,避免随意给业务承诺恢复时间。
优先业务恢复,不执着根因
运维铁则:业务中断时,优先恢复服务,不要死磕根因。
有冗余架构:切换备用链路、备用设备、主备切换、BGP 切换、VPN 切备用通道。
无冗余:临时绕过故障点,降级运行,保障核心业务,非核心业务可临时关停。
涉及运营商专线:第一时间报运营商故障工单,同步链路 ID、故障现象。

二、分层定位排查(由简到繁,缩小故障域)
1)物理层
设备掉电、端口 down、光模块故障、网线 / 光纤损坏、堆叠 / 集群线缆异常。
现象:端口离线、完全不通,无报文。
操作:查看设备日志,更换光模块、线缆,重启故障接入设备。
2)链路层
二层环路、STP 震荡、VLAN 配置错误、MAC 地址漂移、ARP 异常。
现象:时断时续,广播风暴,全网卡顿,丢包严重。
操作:关闭冗余端口破环,查看 MAC 漂移日志,清理异常 ARP。
3)网络层
路由丢失、静态路由错误、OSPF/BGP 邻居中断、ACL / 防火墙策略误拦截、IP 地址冲突。
现象:同网段互通,跨网段不通;部分网段访问异常。
操作:traceroute/tracert 追踪丢包节点,检查路由表、防火墙会话表、ACL 策略。
4)传输 & 业务层
带宽跑满、DDoS 攻击、负载均衡会话打满、DNS 解析故障。
现象:网络通,但访问慢、部分网站打不开,业务超时。
操作:查看带宽流量,清洗攻击流量,切换备用 DNS,检查 LB 会话数。
常用排查工具:ping、traceroute、mtr、tcpdump/wireshark、设备 show 日志、监控大盘。
三、典型突发故障场景处理
外网专线中断
主备链路立刻切换至备用线路;同步运营商排障,业务优先恢复,故障链路后台排查。
二层广播风暴,全网卡顿
快速断开疑似环路端口,关闭接入交换机空闲端口,开启 STP,恢复后定位环路来源。
防火墙 / 核心设备宕机
集群环境自动切换备机;单机设备紧急重启,若硬件损坏启动备用设备。
DNS 故障业务大面积不可访问
临时切换公共 DNS,修改业务本地 hosts 应急,修复内部 DNS 服务器。
疑似 DDoS 攻击
开启流量清洗,黑洞路由,联系运营商清洗,隔离受攻击 IP,保障核心业务。

四、故障修复验证
网络层面:端口 up、路由正常、无丢包、时延恢复正常。
业务层面:业务系统、用户访问、接口全部验证,确认故障消失。
记录故障时间点:故障开始时间、恢复时间、影响范围。
五、故障结束:复盘与预防(非常关键)
输出故障报告:时间线、现象、影响范围、直接原因、根本原因、临时措施、永久整改方案。
整改落地:
架构层面:核心网络做冗余,核心设备双机、链路双专线,消除单点故障。
监控层面:完善告警,端口 down、丢包、带宽、CPU 内存、BGP 邻居、ARP 异常告警。
变更管控:网络变更严格走变更窗口,变更前备份配置,变更后做回滚方案,绝大多数网络故障来自变更。
预案演练:定期演练链路中断、核心设备故障应急切换,避免纸上预案。
六、事前预防,降低突发故障概率
核心网络杜绝单点,设备、链路冗余。
所有网络变更必须准备回滚方案。
定期备份网络设备配置。
完善监控告警,早发现小故障,避免演变成重大突发故障。
定期巡检光纤、光模块、设备硬件状态。
七、运维人员避坑要点
业务中断期间,不要随意做大规模配置修改,越改越乱;优先回滚最近变更。
重大故障操作双人复核,避免手误加重故障。
保存全部设备日志,不要故障恢复后直接清空,日志用于定位根因。
区分临时恢复和彻底根治:切换备用只是临时止损,后续一定要定位原故障点。
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢