案例库 · 软件与 IT · 技术决策 · 2013–2020
IBM通过自己的故障工单预测哪些服务器会出问题
IBM的PASIR系统对故障工单进行分类,找出真正重要的中断,每年带来约10亿美元的可用性提升。
IBM
那一手
大型IT运营会产生海量的故障工单,团队在常规噪声中丢失了真正重要的信号,因此他们修复的是吵闹的问题,而不是关键的问题。
IBM的服务器事故减少预测分析(PASIR)读取每个工单的描述和解决方案并进行分类,识别出表明大量服务器真实宕机和性能下降的事件。
自2013年以来,PASIR已部署到数百个IT环境中,对约85万台服务器进行了分类,并推动了对问题服务器的处理,每年带来约10亿美元的可用性提升和事故减少。该项目是2020年Franz Edelman奖决赛入围者。
为什么管用
- 对工单进行分类将嘈杂的流程转化为按优先级排序的修复清单。
- 专注于高影响事件,将稀缺的工程时间用于预防最大的停机。
- 模型从解决方案文本中学习,因此随着真实修复被记录,分类会不断改进。
- 提高一个环境的可用性可以扩展到数百个环境,使回报成倍增加。
值了多少在故障发生前发现高影响事件利落
可以搬走什么
在嘈杂的警报流中,从众多小事中筛选出少数严重信号,比添加更多监控更具杠杆效应。
后来呢
PASIR已部署到超过360个IT环境,并成为IBM服务交付分析的核心工具。该项目被认可为2020年Edelman决赛入围者,该方法在INFORMS期刊论文中有所描述,影响了企业如何对运营数据进行分类处理。
资料来源
发现哪里写错了?告诉我们。