异常开始时间应通过“指标基线—告警事件—原始样本”三层证据交叉确定,而不是只看告警弹出时间。告警时间通常晚于真实异常起点,因为采集、聚合、阈值判定和通知各有一段延迟。要交付一个团队都认可的结论,需要把异常窗口收敛到可复查的时间段,并说明精度边界。
同一场性能异常,在页面性能监控工具里往往留下三个不同时间:
三者可能相差数分钟到数十分钟。若直接把告警时间写进故障报告,后续复盘会反复返工。
确定起点前先定义“正常”长什么样。常用做法是取异常发生前一段稳定时段的同一指标,计算中位数与分位值,作为对比基线。
判断信号:如果指标连续两个及以上聚合周期超出基线波动范围,可把第一个越界点视为候选起点。若只有一个点越界随即回落,更可能是采样噪声或个别慢请求,不宜作为异常起点。
告警时间可以当作定位线索,但要减去规则本身的延迟。检查项包括:
把告警时间减去这些已知延迟,得到一个“最早可能起点”,再与基线法得到的候选点比对,取两者中更早且能被原始数据支持的时刻。
聚合曲线只能给出大致区间,最终确认要看单条记录。在页面性能监控工具中按时间范围筛选慢请求或长任务样本,观察第一条明显异常的记录出现在什么时刻。
适用条件是样本量足够:如果该时段请求量很低,单条慢请求可能只是偶发,此时应放宽到“时间段”而非精确到秒,并在交付说明中标注置信度较低。
可以执行的核对步骤:
为减少返工,结论应写成可复查的格式,而不是一个孤立时间点。建议包含:异常开始时间及其精度(精确到分钟或时间段)、判定依据的指标与基线、使用的数据口径、以及尚存的不确定因素。
验收信号是:另一位同事拿到这份说明,能独立在页面性能监控工具中复现同样的时间区间,并得出相同结论。若无法复现,说明口径或筛选条件没有交代清楚,需要补充而非争论时间点本身。
下一步:挑一个已发生的异常,分别记录告警时间、聚合越界点和原始样本首条异常记录,比较三者差值,把差值写进团队的排查模板。