EN
返回档案库

案例库 · 软件与 IT · 技术决策 · 2013–2020

IBM通过自己的故障工单预测哪些服务器会出问题

IBM的PASIR系统对故障工单进行分类,找出真正重要的中断,每年带来约10亿美元的可用性提升。

IBM

那一手

大型IT运营会产生海量的故障工单,团队在常规噪声中丢失了真正重要的信号,因此他们修复的是吵闹的问题,而不是关键的问题。

IBM的服务器事故减少预测分析(PASIR)读取每个工单的描述和解决方案并进行分类,识别出表明大量服务器真实宕机和性能下降的事件。

自2013年以来,PASIR已部署到数百个IT环境中,对约85万台服务器进行了分类,并推动了对问题服务器的处理,每年带来约10亿美元的可用性提升和事故减少。该项目是2020年Franz Edelman奖决赛入围者。

为什么管用

  • 对工单进行分类将嘈杂的流程转化为按优先级排序的修复清单。
  • 专注于高影响事件,将稀缺的工程时间用于预防最大的停机。
  • 模型从解决方案文本中学习,因此随着真实修复被记录,分类会不断改进。
  • 提高一个环境的可用性可以扩展到数百个环境,使回报成倍增加。
值了多少在故障发生前发现高影响事件利落

可以搬走什么

在嘈杂的警报流中,从众多小事中筛选出少数严重信号,比添加更多监控更具杠杆效应。

后来呢

PASIR已部署到超过360个IT环境,并成为IBM服务交付分析的核心工具。该项目被认可为2020年Edelman决赛入围者,该方法在INFORMS期刊论文中有所描述,影响了企业如何对运营数据进行分类处理。

资料来源

发现哪里写错了?告诉我们。

同一路聪明