2012 年,当我在 LinkedIn 担任 SRE 时,我设计了一个可以自我修复并从之前的事件中学习的系统。
人工智能的能力远不及我们今天所拥有的,这仍然是一个原型,但现在已经成为现实。
这些工具可以完成这一切:检查警报、形成假设、查询遥测、关联最近的部署,甚至自行实施修复。
尽管我很喜欢看到它,但我有一个主要担忧:我们正在与我们的系统失去联系。
这些工具在解决常规事件方面做得越好,人类响应人员获得的实践就越少。
当发生自动化无法解决的模糊且严重的事件时,响应工程师就会遇到麻烦。
这些人工智能辅助的事件响应工具,通常称为“AI SRE”—— 我不太喜欢的一个词 – 在很多方面都很棒。
当他们在晚上处理例行事件时,你会感觉特别神奇,而你不必因为能力问题而醒来。
问题在于,常规事件也是响应者如何“安全”地形成对其系统行为和故障的直觉的方式。
当人工智能遇到无法解决的前所未见的困难事件时,工程师将不得不以比以前更少的练习来接手。
人为因素研究员 Lisanne Bainbridge 在她 1983 年著名的论文《自动化的讽刺》中描述了这一悖论。
她解释说,自动化减少了操作员练习日常工作的机会,同时让他们对新的和异常情况负责。
因此,她认为操作员需要比自动化之前更加熟练并接受更多的培训。
在未来的几年里,我预测大多数事件的平均 MTTR 将会下降——这要归功于人工智能辅助的事件响应——但复杂事件的解决时间将会急剧增加,因为事件响应者与他们的系统失去了联系并且正在努力调查。
我们可以从航空业中寻找灵感。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜