背景:网络运维自主化的热潮
近期,关于将自治 AI 应用于网络运维(AIOps)的讨论越来越多,许多厂商倡导通过自我修复系统减少人工干预。然而,在涉及关键基础设施的场景中,这种做法是否合适引发了行业反思。
播客核心观点:不应移除人类
在一档网络技术播客中,主持人 Johna 与 John 邀请 Rekha Shenoy(BackBox 首席执行官)和 Richard Phillips(产品及工程副总裁)展开对话。双方重点探讨了在关键基础设施的网络运维中,完全移除人类操作者的目标并不正确。
讨论涵盖以下要点:
- 盲目自主(blind autonomy)带来的风险,即系统在未受监督时自行决策可能引发意外;
- AI 在自我修复逻辑中可能出错的环节,嘉宾强调需审视自动化失效模式;
- 为何人类的经验与上下文判断在复杂故障中仍不可替代。
原讨论提出:“在关键基础设施中,移除人类真的是正确的目标吗?”
对读者的意义 / 技术解读
对于运维、SRE 与网络工程师读者,该观点具有重要的实践指导价值。自我修复系统若缺乏严密的安全护栏,可能因误动作导致二次故障,甚至扩大故障域。例如自动调整路由策略时若误判链路拥塞,可能引入绕路或丢包。
在落地运维自动化时,建议遵循以下原则:
- 将 AI 定位为辅助决策角色,涉及生产环境的关键变更(如路由策略修改、防火墙规则调整)必须保留人工审批环节;
- 建立完善的回滚机制与故障域隔离,确保自动修复失败时可快速撤销;
- 持续评估 AI 建议的准确率,避免由于过多低质量告警造成团队疲劳。
尤其是在跨境链路、核心路由及 DNS 递归服务等敏感场景,应保持人类终裁权,以平衡效率与可用性。运维团队可从小范围、非核心业务开始验证自动化能力,逐步建立信任。