首先应进行三项基础检测:延迟(ping)、丢包(mtr/traceroute)和带宽(iperf3)。用命令:ping -c 20 x.x.x.x、mtr -rw x.x.x.x、iperf3 -c server -t 30。若ping平均值高于100ms、mtr出现持续丢包、或者iperf3吞吐远低于预期,就说明网络质量存在问题。
推荐组合监控:Prometheus + node_exporter(采集主机指标)、Grafana(可视化)、Zabbix/Naemon(告警)、及流量/连接监控工具如iftop、nethogs、vnstat。Prometheus可记录CPU、网络吞吐、TCP连接数并长期保存,Grafana制作仪表盘观察网络质量趋势,Zabbix用于阈值告警。
关键指标包括:入/出带宽、TCP重传、连接数、ICMP延迟、丢包率、接口错误(rx/tx err)。设置基线并在偏离时触发告警,有利于及时响应突发问题。
排查步骤:1)本地与目标互测(ping/mtr),确认延迟在哪一跳暴增;2)使用traceroute或mtr定位问题节点;3)在服务器端用ifconfig/ethtool检查网卡错误与速率;4)用tcpdump抓包分析是否存在重传或RST;5)与上游(IDC/线路商)核对路由与丢包信息。定位到交换/骨干/目标节点后再做后续处理。
推荐命令集合:ping、mtr、traceroute、tcpdump -i eth0、ss -s、ethtool eth0、ifconfig。将关键时间点的抓包和mtr结果保留,便于与运营商沟通。
优化可分为系统级、应用级与链路级:系统级启用TCP优化(如开启sysctl net.ipv4.tcp_congestion_control=bbr并调整tcp_window_scaling、tcp_rmem/tcp_wmem),合理调整文件描述符与net.core.somaxconn;应用级优化使用HTTP/2、Keep-Alive、连接池与CDN分发静态内容;链路级与云服务商沟通调整路由或升级带宽链路。
启用BBR需测试稳定性,调整内核参数后建议在低峰验证;若瓶颈在上游CN2节点,需与服务商协商多路径或更换带宽类型。
建议制定巡检清单:每日检查带宽使用与接口错误、每周核对长周期延迟趋势、每月复核路由与BGP信息。告警策略设为多级:轻微(延迟上升20%)发邮件,中等(丢包>1%或带宽>80%)短信告警,严重(服务不可达或丢包持续)电话升级。并建立故障单流转与问题回溯机制。
运维文档中保留标准化的诊断步骤、命令集、监控看板链接以及与承载/线路商的沟通SLA模板,便于快速定位与闭环处理。