1.
概述与目标
目标:在CN2专线出现故障时于30分钟内完成检测、定位并启动备份线路;在2小时内恢复主服务或稳定走备份线路。小分段:明确SLA、责任人、通知链;制定KPIs(检测时间、恢复时间、通信时效)。
2.
监测与告警步骤(自动化为主)
步骤:1) 在NMS/SIEM中配置对CN2链路的ICMP、BGP邻居状态与流量阈值监控;2) 设置阈值示例:丢包>3%持续5分钟或BGP邻居Down立即告警;3) 告警流程:告警->NOC值班确认->升级到一线工程师。小分段:使用Prometheus+Alertmanager或Zabbix、并和企业微信/短信打通。
3.
现场与远程初步诊断流程
步骤:1) 远程:登录路由器查看BGP状态(show ip bgp summary)、接口状态(show interface)、路由表;2) 现场:检查光纤连接、光模块指示灯、SFP更换并记录光功率;3) 记录:故障开始时间、影响范围、初步怀疑原因。小分段:使用SSH脚本自动收集日志并上传到工单系统。
4.
隔离与影响最小化操作
步骤:1) 若为链路物理故障,立即在路由器上撤销受影响接口的路由学习或人工下线以避免路由震荡;2) 启动备份路径(内部备份专线、互联网IPSec/SD-WAN或MPLS备份);3) BGP切换命令示例:调整local-preference或启用route-map实现快速优先级切换。小分段:保证备份路径的MTU、ACL和NAT策略预先校验通过。
5.
与运营商联络与升级流程
步骤:1) 使用预先建立的SLA联系人表直接拨打运营商应急电话并创建TAC工单;2) 提供必要信息:故障时间、影响端口、光功率、链路ID、截取的日志;3) 跟踪:每30分钟更新一次工单并在内部通报群同步。小分段:保留截图与命令输出作为证据,必要时请求光层勘测或替换光缆。
6.
服务恢复与回滚验证
步骤:1) 在运营商修复或主链路稳定后,先在非生产时段小范围回切并观察48小时;2) 回切命令应先在LAB或旁路验证;3) 回切后执行流量验证(iperf、流量采样)与业务测试(应用层HTTP/TCP事务)。小分段:若回切导致问题,立即回滚并保留故障快照供事后分析。
7.
事后复盘与文档化
步骤:1) 故障结束后24小时内进行会议复盘,明确根因、时间线、决策点及改进项;2) 更新Runbook、操作手册与自动化脚本;3) 将复盘结果写入CMDB并调整SOP。小分段:安排培训与桌面演练以巩固经验。
8.
运维团队角色与值班配置建议
建议:1) NOC(24/7)负责监控与初步处置;2) 一线网络工程师(8:30-18:00,轮班)负责远程诊断与Ops指令执行;3) 外勤工程师(按需呼叫)负责现场光纤、设备更换;4) 通信与客户经理负责对外通报。小分段:推荐规模示例:中型部署NOC 3人/班,2名一线工程师+1名外勤轮班,提供7x24快速响应。
9.
工具、脚本与资源清单
清单:1) CLI脚本模板(备份配置、采集日志、BGP临时策略);2) 监控与告警平台(Zabbix/Prometheus/Alertmanager);3) 现场工具包(光功率计、备用SFP、光纤尾纤、笔记本);4) 通信模板(对内/对外通报邮件与短信模板)。小分段:所有脚本放入版本控制并有审批流程。
10.
问:CN2专线故障时,BGP切换会导致哪些风险?
答:风险包括路由震荡、业务短时中断、路径黑洞及MTU差异导致分片问题。操作上需使用渐进式路由调整(调整local-preference或使用route-map)并做好流量监测与回滚准备。
11.
问:推荐的备份方案有哪些优先级?
答:优先级:1) 专线双路由(不同机房/不同运营商)2) MPLS或SD-WAN混合备份3) IPSec over Internet为最后手段。选择依据为业务重要性、成本和延迟要求。
12.
问:如何评估运维团队是否足够应对突发故障?
答:通过演练与KPI评估:定期桌面/实战演练、统计MTTR/MTTA、响应时间与恢复成功率。若MTTR持续超标或必须频繁调用外勤,则需增加一线/外勤人数或提升自动化水平。
来源:香港沙田cn2专线故障应急预案与运维团队配置建议