
10月7日,混沌工程平台Gremlin正式发布Foresight AI,旨在通过自动化故障注入与修复闭环,提升分布式系统的健壮性。该公司创始人兼CEO Kolton Andrus曾参与维护亚马逊零售网站,并在Netflix构建了早期的故障注入工具。如今,Gremlin试图将“故意破坏系统以验证其稳定性”的理念推向自动化新阶段。
从被动响应到主动防御
Foresight AI的核心在于其部署在客户环境中的智能代理。这些代理能够主动注入延迟、终止Pod或耗尽内存,同时实时监控系统遥测数据。当检测到异常时,系统不仅能识别根本原因,还能生成代码或配置修复方案,并自动执行或推荐该方案,随后重复测试直至弱点消除。整个循环无需工程师持续干预,仅在关键节点保留人工审批权。
支撑这一能力的是Gremlin所谓的“故障图谱”(Failure Atlas)。据官方介绍,这是同类中唯一的记录库,汇集了过去十年间在数万个系统中进行的数百万次实验结果。与依赖互联网碎片信息的大型语言模型不同,Foresight背后的模型基于观察到的因果关系进行推理,从而减少幻觉,提供更务实的建议。
应对AI加速开发的副作用
Andrus指出,当前AI驱动的开发模式使代码发布速度提升了10倍,但也意味着Bug、风险和故障机会同步增加了10倍。传统的可观测性工具通常在问题影响生产环境后才捕获异常,而Foresight则能在警报触发前扫描潜在故障模式,并以基础设施即代码变更或配置补丁的形式提供修复方案。
该系统还会重新运行暴露风险的精确实验以验证修复效果,并通过可靠性评分跟踪服务及团队的进展,为管理层提供量化数据支持。一位投资者指出,许多工程团队缺乏时间或专业知识来持续进行混沌实验,而Foresight使这一过程自动化且可衡量。
信任与安全边界
尽管前景诱人,但授予代理程序破坏类生产系统的权限仍需高度信任。对此,Gremlin强调其在受监管环境中运行,持有SOC 2 Type II认证,并为隔离网络提供私有版,利用AWS PrivateLink确保数据保留在客户云内部。此外,产品设计上保留了人类在关键节点的参与,反映了对真实失败经验的尊重。
目前,Foresight作为Gremlin原有故障注入平台的附加组件推出。虽然初步定价细节有限,但公司强调其可衡量的成果:通过仪表板展示随时间推移的风险变化和进展。行业观察人士认为,随着分布式系统日益复杂,这种从“事后清理”转向“事前发现并修复”的能力,将成为SRE实践的重要演进方向。