Agent 遇到 429、坏 JSON 和重复调用时怎么测:用 ResiliReplay 把故障轨迹变成回归测试
给 Agent 补单元测试并不等于验证它能在真实故障里恢复。一次工具调用可能超时,模型端可能返回截断 JSON,网络重试又可能把写操作做两遍;MCP 服务还会带来 schema 演进、权限失败和有副作...
最新内容
给 Agent 补单元测试并不等于验证它能在真实故障里恢复。一次工具调用可能超时,模型端可能返回截断 JSON,网络重试又可能把写操作做两遍;MCP 服务还会带来 schema 演进、权限失败和有副作...
让编码 Agent 生成演示文稿,最常见的失败并不是“内容写得不够漂亮”,而是产物不可审查。.pptx 本质是一组体积不小的 XML 与媒体文件:人类可以在 PowerPoint 里拖拽修正,模型却难...
团队同时使用 Claude Code、Codex 和 Gemini CLI 时,真正难管的通常不是某一次提示词,而是工程边界:不同成员装了不同版本;MCP 服务要重复配置;一次任务里的研究、实现和测试...
AI 编码 Agent 做到第十几轮以后,问题往往不是模型突然变笨,而是会话状态开始失控:为了保留此前的决策、命令输出和失败线索,客户端反复携带越来越长的历史;为了压低输入量,又有人在 system ...
AI 编码工具的账单很容易制造一种错觉:本月花了多少、某个模型占多少,看起来已经足够管理成本。但对开发团队来说,真正要回答的并不是“总共烧了多少 token”,而是“哪些已经合并的变更值得这笔钱”“哪...
排查一条来自公网的异常请求时,日志通常只给出 IP:8.8.8.8、203.0.113.x 或一串反向代理转发链。单独看地址,很难决定它该进入哪条处理路径:这是公司云出口、已知 CDN、某个普通运营商...
让 Claude Code、Codex 一类编码 Agent 直接操作真实项目,效率往往来自它们拥有和开发者相同的权限:能改代码、运行脚本、读配置、删除生成文件。风险也在同一处。一次错误的“清理”、不...
让编码 Agent 改一个按钮颜色、补一个表单校验,最常见的交付证据仍是“已完成”或一张截图。问题不在于截图没有价值,而在于它通常不能回答三个工程问题:当前页面是否真加载了新代码?某个交互后的状态是否...
传统单元测试擅长断言“函数输入 A,得到输出 B”。但把大模型、工具调用和多步循环放进应用后,测试目标随之改变:同一问题的自然语言输出不一定逐字相同;模型可能在不改业务代码的情况下更新;工具名称、调用...
线上事故发生时,信息并不总在一个可检索的地方。你可能刚在 Grafana 面板看到一次尖峰,又在日志窗口扫到半截 trace ID;切去 Slack 回答同事后,原来的面板被覆盖,下一分钟已很难复述「...