为什么三个指标要分开看
很多人习惯用 ping 延迟作为节点质量的唯一标准,但这只是三分之一。延迟(Latency)、丢包(Packet Loss)和抖动(Jitter) 各自反映的是不同维度的问题,修复方向也完全不同。
延迟:链路长度的体现
RTT(往返时延)主要由物理距离和路由跳数决定。跨洋线路的 100ms 是正常的,同城节点的 30ms 却说明有问题。评估延迟时需要区分:
- 基准延迟:空负载下的 RTT,反映物理路径
- 业务延迟:实际负载下的 RTT,包含队列等待
- 首包延迟:协议握手到第一个数据包的时间,影响体感
丢包:最伤害 TCP 应用的指标
丢包率超过 1% 就会触发 TCP 重传,在视频会议、文件下载等场景下明显感知。随机丢包通常来自链路拥塞,突发性丢包则往往是 QoS 限速或中间设备故障。两者的处理方式不同,不能混为一谈。
抖动:实时业务的隐形杀手
抖动是延迟的方差,对语音、视频等实时流量影响最大。即使平均延迟很低,如果抖动超过 30ms,通话质量就会明显下降。降低抖动的主要手段是流量整形和优先级队列,而不是简单地加大带宽。
如何在监控系统中落地
建议每个节点维护三条独立的探针时序数据,采集频率 30~60 秒,保留至少 7 天历史。异常触发条件示例:
- 延迟连续 3 次超过阈值的 2 倍 → 降权
- 丢包率超过 2% 持续 5 分钟 → 告警
- 抖动超过 50ms 且持续上升 → 标记异常