← 返回 技术博客

技术文章

智能异常检测:衡石 BI 指标监控的统计学与机器学习融合技术

解析衡石 BI 如何结合统计方法、时间序列分解与机器学习,识别周期、趋势和多维组合异常,并通过归因与告警降噪提升指标监控质量。

2026/08/14技术博客HENGSHI4 分钟阅读
异常检测指标监控机器学习时间序列Agentic BI衡石科技

Article body

正文

引言

传统 BI 监控常用固定阈值,例如销售额低于 100 万元就告警。这种方法容易遇到两个问题。

阈值无法适应业务变化。 双十一的销售额和平时不同,季节性业务也不能长期使用一个固定阈值。阈值过低会在大促期间频繁误报,阈值过高又可能漏掉真正的异常。

固定阈值只能判断单点,无法识别趋势。 某指标本期为 102 万元,没有触发低于 100 万元的告警,但前两期分别为 150 万元和 148 万元。连续下滑才是需要关注的信号。

智能异常检测(Anomaly Detection)用统计学和机器学习刻画数据的正常形态,再识别偏离周期、趋势和波动范围的异常。 衡石 BI 在指标监控体系中提供多算法融合的异常检测能力。


一、固定阈值的局限

1.1 三个盲区

周期性误判

零售业务的周末销售额可能是工作日的三倍。按照工作日设置阈值,周末会频繁告警;按照周末设置阈值,工作日的低值又可能被忽略。固定阈值无法表达不同周期位置的正常范围。

趋势性漏判

指标从 150 缓慢下降到 102,每周只跌一点,单周都没有触发告警,但累计跌幅已达 32%。等到指标跌破固定阈值,问题可能已经持续多周。

多维组合盲区

华东区整体销售额正常,不代表“华东区 × 新产品线 × 移动端”这个细分组合正常。单维监控无法发现这种多维组合异常。

1.2 智能检测的思路

智能异常检测先学习数据的正常形态,再找出偏离正常形态的数据点。

正常形态不是一个固定数字,而是一段历史行为模式,包括均值、波动范围、周期和趋势。检测算法从历史中学习这些模式,再判断新数据偏离模式的程度。


二、衡石 BI 的异常检测算法矩阵

衡石 BI 根据数据特征选择或组合多种算法。

2.1 统计学方法

3σ 原则(均值与标准差)

在数据近似服从正态分布时,超过均值正负三倍标准差的值可以视为异常。

  • 适用场景:分布接近正态且没有明显周期的指标,例如系统响应时间和错误率。
  • 局限:难以处理周期性数据,对长尾分布也不够敏感。

IQR(四分位距)

用下四分位数 Q1 和上四分位数 Q3 定义正常范围:[Q1 - 1.5 × IQR, Q3 + 1.5 × IQR]。超出范围的值视为异常。

  • 适用场景:非正态分布数据。IQR 对极端值更稳健。
  • 局限:仍然无法直接处理周期性。

环比和同比偏差

这类方法直接比较当前值与历史参照:

  • 环比:当前值除以上期值再减 1,偏差超过设定范围时告警。
  • 同比:当前值除以去年同期值再减 1,偏差超过设定范围时告警。

环比适合捕捉短期突变,同比适合识别相对长期基准的偏移。两者对每期小幅变化造成的缓慢漂移不够敏感。

2.2 时间序列分解

带有周期和趋势的数据,可以先拆分为三个部分:

  • 趋势项(Trend):长期上升或下降方向。
  • 周期项(Seasonality):日、周或年等固定周期波动。
  • 残差项(Residual):移除趋势和周期后剩余的波动。

系统在残差项上执行异常检测。某个数据点在移除趋势和周期后仍超过统计阈值,才被判定为异常。

这种方法适合零售日销、电力负荷和网站流量等强周期指标。衡石可采用 STL(Seasonal-Trend decomposition using Loess)或基于 Fourier 变换的周期提取方法。

2.3 机器学习方法

孤立森林(Isolation Forest)

孤立森林使用随机分割树识别少见且与其他数据不同的点。正常点通常需要较多次分割才能隔离,异常点只需少量分割。

该算法适合识别多维组合异常,例如转化率下降、客单价上升和访问时长缩短同时出现的模式。

LSTM 自编码器

LSTM 自编码器学习时间序列的正常模式并重建输入序列。重建误差较大的数据点会被视为异常。

该方法适合具有长期依赖和复杂模式的数据,例如多年积累的分钟级监控数据。它需要较多历史数据和训练资源,可解释性也较弱,因此更适合高价值核心指标。

LOF(局部离群因子)

LOF 比较一个数据点与邻近点的局部密度。某点的密度明显低于其邻居时,系统将其标记为异常。

该方法适合发现数据空间中的局部异常簇,例如某个细分市场的异常行为。

2.4 算法选择策略

衡石 BI 根据数据特征匹配算法:

  • 强周期数据使用时间序列分解。
  • 多维组合数据使用孤立森林。
  • 近似正态且长期稳定的数据使用 3σ 或 IQR。
  • 有明确同期基准的数据使用环比或同比偏差。
  • 历史数据充足的核心指标可以选用 LSTM 自编码器。

用户设置高或低敏感度,系统在这个范围内调整算法参数。高敏感度会发现更多信号,也可能增加误报;低敏感度只提示较严重的异常。


三、异常检测的工程实践

3.1 基线学习期

新指标需要先积累数据,学习正常形态:

  • 学习期长度:至少覆盖两个完整周期。周周期指标通常至少需要两周;年周期指标需要更长历史,也可以用迁移学习缩短冷启动时间。
  • 学习期行为:系统收集数据但暂不触发告警,避免冷启动误报。
  • 学习结果:系统生成均值、方差、周期和趋势等基线参数,然后开始检测。

历史不足时,系统可以参考高度相关的相似指标。例如,华南区销售额可以借用全国销售额的基线做初始估算。

3.2 多维异常钻取

整体销售额正常时,细分组合仍可能异常。例如,系统发现“销售额 × 华东 × 线上 × 家电”环比下降 28%。

系统可以:

  • 按常用分析维度对指标组合做预聚合。
  • 为各组合运行异常检测。
  • 发现异常后沿维度层级钻取,定位异常最集中的组合。

最终输出不只说明销售额异常,还可以指出华东线上家电组合贡献了整体下降的 62%。

3.3 告警降噪

大量低价值告警会让用户忽略真正重要的信号。衡石使用四种方式减少告警噪声。

告警分级

  • P0(严重):偏离基线超过 3σ 或跌幅超过 50%,立即告警。
  • P1(关注):偏离 2σ 至 3σ 或跌幅 20% 至 50%,进入每日摘要。
  • P2(观察):偏离 1σ 至 2σ,仅记录而不主动告警。

根因合并

同一个根因造成多个指标异常时,系统把它们合并为一条根因告警。例如,数据源延迟导致多个指标异常时,只提示数据源延迟及受影响指标。

静默期

同一指标的同类异常在 24 小时内只实时告警一次,持续异常进入每日摘要。

动态抑制

大促期间,系统可以切换到基于历史大促数据的基线,减少促销波动造成的误报。

3.4 异常解释与归因

系统发现异常后,还会尝试解释原因。

相关性分析:检索同一时段的其他指标变化。例如,销售额下降时网站可用性也从 99.9% 降到 97%,系统会把服务波动列为可能原因。

事件关联:接入营销活动、系统维护和节假日等企业事件,判断异常是否与已知事件重合。

自然语言解释:系统把检测和归因结果组织成文字,例如说明异常发生时间、幅度、相关指标和建议排查项。


四、异常检测与 Agentic BI 的协同

4.1 检测触发分析

传统流程把异常告警交给人工,再由人工分析。Agentic BI 可以在检测到异常后触发 Data Agent,由 Agent 执行根因分析并生成报告。用户收到的是带有分析结论的报告,而不只是一个待处理的异常信号。

4.2 反馈闭环

用户对告警的反馈可以回流到检测模型:

  • 用户标记误报后,系统调整该指标的敏感度或基线。
  • 用户确认真实问题后,系统增强对相似模式的检测权重。

持续反馈帮助检测系统逐步适应具体业务。


五、常见问题与处理方式

问题 1:历史异常污染基线

如果学习期包含促销峰值或故障数据,基线会被拉偏,正常数据也可能被判为异常。

处理方式:学习基线前使用中位数绝对偏差(MAD)等稳健统计方法识别并排除历史异常点。

问题 2:忽视数据粒度

日销售额和分钟级销售额的噪声水平不同,不能直接使用相同参数。

处理方式:先对实时数据执行时间窗口平滑,例如五分钟滚动平均,再根据数据粒度设置算法参数。

问题 3:所有指标共用一套敏感度

统一参数可能让核心指标漏报,也可能让次要指标频繁误报。

处理方式:按业务重要性分级配置。毛利率、营收等核心 KPI 使用较稳健的阈值,探索性指标可以提高敏感度。


六、总结

企业指标从几十个增长到数千个后,固定阈值难以覆盖周期、趋势和多维组合变化。衡石 BI 的异常检测能力包含三项核心设计:

  • 算法矩阵:组合统计方法、时间序列分解和机器学习,并按数据特征匹配。
  • 多维钻取:从整体指标异常定位到具体细分组合和贡献来源。
  • 智能降噪:通过告警分级、根因合并、静默期和动态抑制控制告警数量。

指标监控由此可以在数值越过固定边界之前,发现偏离正常模式的信号。

HENGSHI SENSE

丰富的资源 完整的生态

邀您成为衡石伙伴

立即加入

企业级部署、产品集成与试用咨询均可快速响应