AI Agent 的测试为什么总是测不住?Weir 用 OpenTelemetry 追踪做数据流安全门禁
很多 Agent 测试停留在“模型有没有调用正确工具”“最终回答是不是包含某个字符串”。这种测试对确定性函数很有用,但对真实的 Agent 工作流还不够:敏感数据可能先从工具结果进入上下文,再被模型改...
最新内容
很多 Agent 测试停留在“模型有没有调用正确工具”“最终回答是不是包含某个字符串”。这种测试对确定性函数很有用,但对真实的 Agent 工作流还不够:敏感数据可能先从工具结果进入上下文,再被模型改...
AI Agent 的测试难点,不在于能否把一次函数调用断言为 True,而在于它面对多轮对话、工具失败和任务分支时,是否仍然做出了安全且可解释的选择。传统单元测试擅长验证确定性函数,却很难描述“用户先...
让多个编码 Agent 同时处理一个需求,瓶颈往往不是“能不能生成代码”,而是怎样避免它们互相踩文件、把未经检查的改动推到真实远端,以及怎样让人能逐块判断变更是否值得合并。常见的做法是给每个 Agen...
AI Agent 经常能帮我们整理餐厅、规划行程,却在“离这里步行 15 分钟以内的咖啡店”“比较两个街区的生活便利度”这类问题上显得不可靠。原因并不只是模型能力不够:很多地图接口返回的是庞大的原始数...
AI Agent 一旦从命令行脚本进入生产环境,排查问题就不再是“最后一次模型回答是什么”。一次看似简单的请求,可能经过路由、检索、多个工具调用和几轮模型重试;如果只记录最终文本,开发者看不到哪一步变...
ERP(企业资源计划)软件常常在两个方向之间拉扯:一端是功能齐全、部署和定制成本也很高的大型系统;另一端则是由表格、SaaS 和脚本拼接出来的业务流程。Celerp 选择了另一个值得开发者关注的方向:...
给 Agent 接上邮件、HTTP、Shell 或数据库工具之后,风险往往不在模型会不会说出一段不当文本,而在它会不会真的执行一次不该执行的调用。一个看似正常的网页、工单或日志里可以混入间接提示注入:...
很多小型服务的异步需求并不复杂:用户下单后发一封邮件、生成一份导出文件、同步到第三方 API。业务数据已经放在 SQLite,队列却常常被拆到 Redis、Celery 或另一套消息系统中。系统看似更...
把小型语言模型放到手机上,再让它调用安全工具,听起来很像“随身的自动渗透测试员”。Nightcrawler 的价值恰好不在于把这件事包装成炫技:它把本地模型、工具调用和网络访问限制拆成不同层,迫使使用...
很多产品里的“去背景”一开始只是一个按钮:上传图片,等云端返回一张透明 PNG。真正把它接入内容生产、商品图生成或视频处理流水线后,问题会变得具体:原图能否不离开本机?透明边缘是否可以保留而不是粗暴二...