AMYTELECOMGLOBAL LINK ENGINEERING
登录下载
AI运维

AI识别异常流量时,怎样避免把正常高峰误判为故障

模型需要学习周期、业务场景与维护窗口,否则突发活动和真实故障可能呈现相似曲线。

从现场现象开始

在“从现场现象开始”的第1项观察中,讨论AI异常识别时,先把用户看到的现象与系统内部过程分开。在“从现场现象开始”的第1项观察中,周期性高峰不一定是异常,所以“从现场现象开始”不能只依赖一个总分或一次截图。继续从终端侧复核“从现场现象开始”的第1项时,还要结合周期性高峰不一定是异常与实际任务结果。“从现场现象开始”第1项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“从现场现象开始”的第2项观察中,同一条链路在不同时间出现差异,并不必然代表设施突然失效。在“从现场现象开始”的第2项观察中,业务高峰、背景更新、无线竞争与目标服务负载都可能改变AI异常识别的结果。继续从接入侧复核“从现场现象开始”的第2项时,还要结合训练资料缺少故障样本会造成偏差与实际任务结果。“从现场现象开始”第2项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“从现场现象开始”的第3项观察中,测量前应固定设备、接入方式、目标地址和测试时段。在“从现场现象开始”的第3项观察中,这样再次观察AI异常识别时,变化才有共同基准,也能排除无关条件。继续从骨干侧复核“从现场现象开始”的第3项时,还要结合模型告警仍需回到原始指标核对与实际任务结果。“从现场现象开始”第3项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“从现场现象开始”的第4项观察中,平均值适合概括整体水平,却可能隐藏短暂尖峰。在“从现场现象开始”的第4项观察中,对AI异常识别而言,分位数、抖动和连续失败往往比单一平均数更接近实际体验。继续从接收侧复核“从现场现象开始”的第4项时,还要结合周期性高峰不一定是异常与实际任务结果。“从现场现象开始”第4项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“从现场现象开始”的第5项观察中,如果只记录“能用”或“不能用”,后续很难知道问题发生在哪一段。在“从现场现象开始”的第5项观察中,终端、接入层、区域交换、骨干段和目标服务应分别留下结果。继续从终端侧复核“从现场现象开始”的第5项时,还要结合训练资料缺少故障样本会造成偏差与实际任务结果。“从现场现象开始”第5项的分段核对,可以避免把局部变化解释成整条链路的结论。

把等待时间分段

在“把等待时间分段”的第1项观察中,讨论AI异常识别时,先把用户看到的现象与系统内部过程分开。在“把等待时间分段”的第1项观察中,训练资料缺少故障样本会造成偏差,所以“把等待时间分段”不能只依赖一个总分或一次截图。继续从接入侧复核“把等待时间分段”的第1项时,还要结合训练资料缺少故障样本会造成偏差与实际任务结果。“把等待时间分段”第1项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“把等待时间分段”的第2项观察中,同一条链路在不同时间出现差异,并不必然代表设施突然失效。在“把等待时间分段”的第2项观察中,业务高峰、背景更新、无线竞争与目标服务负载都可能改变AI异常识别的结果。继续从骨干侧复核“把等待时间分段”的第2项时,还要结合模型告警仍需回到原始指标核对与实际任务结果。“把等待时间分段”第2项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“把等待时间分段”的第3项观察中,测量前应固定设备、接入方式、目标地址和测试时段。在“把等待时间分段”的第3项观察中,这样再次观察AI异常识别时,变化才有共同基准,也能排除无关条件。继续从接收侧复核“把等待时间分段”的第3项时,还要结合周期性高峰不一定是异常与实际任务结果。“把等待时间分段”第3项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“把等待时间分段”的第4项观察中,平均值适合概括整体水平,却可能隐藏短暂尖峰。在“把等待时间分段”的第4项观察中,对AI异常识别而言,分位数、抖动和连续失败往往比单一平均数更接近实际体验。继续从终端侧复核“把等待时间分段”的第4项时,还要结合训练资料缺少故障样本会造成偏差与实际任务结果。“把等待时间分段”第4项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“把等待时间分段”的第5项观察中,如果只记录“能用”或“不能用”,后续很难知道问题发生在哪一段。在“把等待时间分段”的第5项观察中,终端、接入层、区域交换、骨干段和目标服务应分别留下结果。继续从接入侧复核“把等待时间分段”的第5项时,还要结合模型告警仍需回到原始指标核对与实际任务结果。“把等待时间分段”第5项的分段核对,可以避免把局部变化解释成整条链路的结论。

判断适用范围

在“判断适用范围”的第1项观察中,讨论AI异常识别时,先把用户看到的现象与系统内部过程分开。在“判断适用范围”的第1项观察中,模型告警仍需回到原始指标核对,所以“判断适用范围”不能只依赖一个总分或一次截图。继续从骨干侧复核“判断适用范围”的第1项时,还要结合模型告警仍需回到原始指标核对与实际任务结果。“判断适用范围”第1项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“判断适用范围”的第2项观察中,同一条链路在不同时间出现差异,并不必然代表设施突然失效。在“判断适用范围”的第2项观察中,业务高峰、背景更新、无线竞争与目标服务负载都可能改变AI异常识别的结果。继续从接收侧复核“判断适用范围”的第2项时,还要结合周期性高峰不一定是异常与实际任务结果。“判断适用范围”第2项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“判断适用范围”的第3项观察中,测量前应固定设备、接入方式、目标地址和测试时段。在“判断适用范围”的第3项观察中,这样再次观察AI异常识别时,变化才有共同基准,也能排除无关条件。继续从终端侧复核“判断适用范围”的第3项时,还要结合训练资料缺少故障样本会造成偏差与实际任务结果。“判断适用范围”第3项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“判断适用范围”的第4项观察中,平均值适合概括整体水平,却可能隐藏短暂尖峰。在“判断适用范围”的第4项观察中,对AI异常识别而言,分位数、抖动和连续失败往往比单一平均数更接近实际体验。继续从接入侧复核“判断适用范围”的第4项时,还要结合模型告警仍需回到原始指标核对与实际任务结果。“判断适用范围”第4项的分段核对,可以避免把局部变化解释成整条链路的结论。

在“判断适用范围”的第5项观察中,如果只记录“能用”或“不能用”,后续很难知道问题发生在哪一段。在“判断适用范围”的第5项观察中,终端、接入层、区域交换、骨干段和目标服务应分别留下结果。继续从骨干侧复核“判断适用范围”的第5项时,还要结合周期性高峰不一定是异常与实际任务结果。“判断适用范围”第5项的分段核对,可以避免把局部变化解释成整条链路的结论。