AI SRE 真的会排查故障吗?Project Arena 用 21 个 Kubernetes 场景把调查能力变成可复现基准
让 AI Agent 处理 Kubernetes 告警,最难的往往不是“能不能调用 kubectl”,而是它能否在相同故障、相同证据和相同评分标准下,稳定地找出根因并提出安全的缓解方案。Project Arena 是 Edge Delta 发布的一个 MIT 许可证项目,目标正是把这件事做成可重复的基准测试,而不是一次性的演示。
它测量的是什么
Project Arena 会部署一个可销毁的 Kubernetes 测试环境,注入预先定义的故障,让被测产品完成调查,然后保存调查记录,最后交给可配置的 AI judge 评分。整个流程拆成“部署应用—接入产品—注入并验证故障—完成调查—保存记录—评分—比较结果”七步,因此不同观测平台、CLI 或 Agent 可以使用同一套事故素材进行对比。
项目提供两种规模:完整套件包含 21 个场景,smoke 套件包含 6 个场景。集群可以选择本地 kind 或 AWS EKS;集群类型与场景套件是两个独立选择。Python 3.10+ 是唯一的 Python 依赖,Kubernetes 操作还需要 kubectl;本地 kind 路径则额外需要 Docker 和 kind。
值得注意的是,基准并不只看“有没有报警”。README 将结果拆成检测、根因分析、影响范围、可支持的最终缓解措施,以及实施准备度。最后两项衡量的是建议是否具体、是否有依据,并不代表项目已经自动执行修复或验证恢复。这种边界很重要:一段看似专业的事故总结,如果给出未经证据支持的修复,同样不应拿到高分。
官方数据说明了什么
项目 README 给出的 21 场景结果中,Edge Delta 原生调查检测并调查了 18 个场景,Grafana 原生调查完成了 12 个。使用各平台 CLI 的 Claude 调查则在每个平台上都启动了 21 个场景,但 Claude 的检测能力没有被独立测量,因此对应检测栏标为“未测量”。
在根因分析上,Edge Delta 为 15/18,Grafana 为 9/12;Claude 加 Edge Delta CLI 为 18/21,Claude 加 Grafana CLI 为 19/21。影响范围识别方面,两个 Claude 组合都是 18/21。可支持的最终缓解措施则分别是 16/21 和 15/21。这里不能简单理解为“某个模型永远更强”:项目明确提醒,不同产品的启动提示、时间和可用证据存在差异,表格的价值在于公开测试方法和原始分母,而不是制造一个脱离上下文的排行榜。
跑通最小流程
克隆仓库并准备好 kind、Docker、kubectl 后,先初始化运行配置:
python3 -m bench init python3 -m bench catalog python3 -m bench deploy
编辑生成的 arena.json,至少确认 Kubernetes context、产品名、唯一的 run_id、输出目录、full 或 smoke 套件,以及 judge 的 provider 和 model。完整套件随后可以注入并验证故障:
python3 -m bench fault python3 -m bench verify python3 -m bench evidence
让观测产品完成调查后,把 final.txt、可选的 intermediate.txt 和 actions.txt 放入对应场景目录,再导入记录:
python3 -m bench archive python3 -m bench packet python3 -m bench judge python3 -m bench report --summary > summary.csv
judge 使用指定模型,把调查内容、场景答案和评分规则组合起来,输出 judgment.json。比较多个产品时,应坚持使用相同的 judge 模型与配置;否则模型差异可能掩盖被测工具本身的差异。API 调用也可能产生费用,密钥应放在环境变量中,不要写进 arena.json。
对 AI Agent 开发者的启发
Project Arena 最有价值的地方不是又一个故障注入脚本,而是把“调查质量”拆成可以复核的记录。Agent 不应只输出一段流畅的总结,还应保留它看到的证据、采取的工具动作、根因判断和缓解建议。这样才能分析它是在检测阶段失败,还是找到了症状却误判了根因。
对于团队,比较可靠的接入方式是先用 smoke 套件验证导出格式,再进入完整套件;把每次运行的 context、套件、场景和 judge 配置固定下来;把结果 CSV 纳入回归测试。当 Prompt、工具权限或观测数据发生变化时,重新跑一组场景,比凭印象判断 Agent“变聪明了”更可信。
Project Arena 也没有承诺自动修复生产事故。它提供的是隔离环境、故障样本、记录格式和评分框架。真正上线前,仍需要人工审查权限边界、网络策略、回滚方式和缓解建议。对 AI SRE 来说,能解释“为什么这样判断”与“证据是否足够”,比单纯生成一条 kubectl 命令更加重要。