先收集故障信息:时间、影响范围(单台/机柜/网络段)、是否全站不可达、最近变更记录(配置/补丁/换线)。确认责任边界:机房本地负责、承载链路运营商(CN2)、云/托管服务商。准备好远程登录凭证、交换机/路由器控制台接入方式(IPMI/串口服务器/跳板机)和故障上报模板。
必要工具:ssh、telnet、ping、traceroute/mtr、tcpdump、ethtool、ifconfig/ip、netstat、show 命令(交换机/路由器)、光模块诊断工具、站点监控/告警面板。

1)确认告警与监控:查看监控平台(Zabbix/Prometheus/Datadog)对应告警时间与指标(丢包、延迟、接口down、CPU、内存)。
2)验证连通性:从运维端执行 ping -c 10 <目标IP>;若丢包或超时,执行 traceroute -w 2 -q 1 <目标IP> 或 mtr,确认故障跳点。
接入机房本地工程师:检查光纤连接、跳线、光衰标识;若可用,使用光功率计或交换机 SFP diag(例:ethtool -m ethX 或 show interface transceiver)查看光模块温度/电压/接收功率。检查端口指示灯与错误计数(CRC/align/late collisions)。
如果光功率异常或 SFP 报错,换备件光模块与跳线做 A/B 测试,并记录更换前后值;与运营商确认中间光路是否有维修计划或故障告警。
在交换机/路由器上检查接口状态:show interface [ifname],关注状态(up/down)、输入输出错误、流控事件。若接口 flapping,临时做 port-channel 降级或把故障口从链路聚合中移除。
检查 ARP / MACT 表:ip neigh 或 show mac address-table,确认是否存在 MAC/ARP 冲突。对疑似环路的端口执行 errdisable recovery 或手动 shutdown/ no shutdown,并观察 MAC 学习变化。
查看 BGP 邻居状态:show ip bgp summary 或 vtysh / bgp show neighbors,确认邻居是否建立、是否有 prefix 收发。若邻居 Down,检查 TCP 连接(netstat -an | grep 179)和路由策略(route-map/ prefix-list)是否误封锁。
遇到不一致路由时,使用 show ip bgp <前缀> 或 bgp table 查看 AS path 与 next-hop。必要时实施软重启或 graceful-restart:clear ip bgp
登录受影响主机后,先检查网络接口:ip addr show / ip link show,重启网口:sudo ip link set dev eth0 down && sudo ip link set dev eth0 up;查看 ethtool eth0 的速率/协商情况。
抓包定位:tcpdump -i eth0 host
1)分离问题域:在不同跳点上做 ping/mtr,确定丢包开始的节点。2)如果是链路层丢包,检查接口错误计数并更换光模块或调整速率/协商参数(ethtool -s eth0 speed 1000 duplex full autoneg off)。
3)对 TCP 服务可临时调整拥塞/重传参数:sysctl net.ipv4.tcp_retries2=5 等,或在负载均衡层做流量切换至健康节点以降低影响。
先制定最小影响恢复方案:先做配置回滚到最近稳定点,使用配置管理工具(Ansible/Git)回退。若需重启核心设备,预先通知上下游并在低峰窗口执行,记录时间点与回退命令。
执行恢复后做稳定性验证:连续 30 分钟内无错误计数、BGP 稳定、关键业务请求响应正常;随后更新 RCA 文档并通知变更完成。
答:优先检查链路与光模块(物理层)→ 接口错误/流控 → BGP 邻居与路由表 → 主机网卡与防火墙策略。因为 CN2 多为承载链路,物理或运营商侧问题最常见,应第一时间与承运商 NOC 对接并提供 traceroute/mrt 数据。
答:先确认 TCP 层是否频繁重建(检查路由器日志与 netstat),检查 MTU、ACL、TTL 及 route-map 导致的持续拒绝。可临时对该邻居配置 dampening 或 apply route-map 限制更新频率,并与对端协调调整 keepalive/holdtime,最终在维护窗口内做根因修复。
答:提供故障开始时间、受影响 IP/ASN、traceroute/mtr 输出、ping 丢包率、光模块诊断值(Rx/Tx dBm)、接口错误计数、BGP 的 show logs 与邻居状态截图、是否有配置变更记录。这样有助于对方快速定位链路或路由问题。