什么是异常检测?AI 如何从数据中发现不寻常的变化
异常检测是什么?AI 如何识别交易、流量和设备数据中的异常模式,它与故障判定有什么区别,以及如何减少误报。
编辑部 ·
异常检测(Anomaly Detection)是从大量数据中找出“不符合常态”的记录、变化或模式。它常被用于发现可疑交易、突然升高的系统流量、设备传感器的异常读数,或生产流程中的偏差。
“异常”不等于“错误”。一笔金额很高的订单可能是正常的大客户采购;一次流量暴涨可能来自成功的营销活动。异常检测做的是把值得关注的信号排到前面,最终仍要结合业务背景判断。
异常可以是什么样子?
常见异常大致有三类:
- 单点异常:某一个数值明显偏离常见范围,例如温度突然飙升;
- 情境异常:数值本身不奇怪,但出现在不合适的时间或条件下,例如凌晨出现大量登录;
- 群体异常:单条记录看似正常,但一组记录组合起来不寻常,例如多个账户以相同节奏反复操作。
这也是为什么简单设置一个固定阈值并不总够用。周一上午的访问量可能远高于深夜,但二者都很正常。
AI 如何判断“不同寻常”?
最基础的方法是根据历史均值和波动范围设定阈值。更复杂的方法会学习正常数据的分布、季节规律和多项指标之间的关系。
例如,一台设备的温度略高、振动略高、耗电也略高,分别看都可能未超标;放在一起看,却可能提示它的运行状态已经偏离正常模式。模型还能随着数据更新调整基线,避免把长期增长的业务量一直误报为异常。
在缺少“异常标签”时,无监督方法会先学习正常模式,再找出距离较远的样本;在有历史处置结果时,监督学习可以进一步学习哪些异常最值得优先处理。
适合哪些业务场景?
- 安全与风控:筛选可疑登录、支付或账户行为;
- 系统运维:发现接口错误率、延迟和资源消耗的异常;
- 工业与物联网:监测设备状态,辅助预防性维护;
- 数据质量:发现缺失、重复、突变和异常格式;
- 经营监控:及时注意订单、退款或转化率的反常波动。
最有效的用法通常是“告警 + 证据”。告警应附带相关时间段、对比基线和关联指标,让处理人员可以快速判断原因。
如何减少误报和漏报?
异常检测往往需要在两者之间权衡。阈值太敏感,会产生大量无意义告警;阈值太宽松,则可能错过真正的问题。
可以从以下方面改进:
- 依据业务时段、地区或用户类型建立不同基线;
- 把节假日、发布活动和计划维护等已知事件纳入判断;
- 为不同风险等级设置不同的处置流程;
- 定期回看告警结果,用人工反馈调整规则和模型;
- 对高风险告警保留人工复核,而不是自动下结论。
小结
异常检测的核心不是给数据贴上“对”或“错”的标签,而是尽早发现值得调查的偏离信号。将模型结果与业务上下文、清晰证据和人工复核结合,才能让告警真正提升效率,而不是制造噪声。