桌面 AI Agent 能操作电脑,也必须被关进边界里:Moching 安全实践
当 Agent 只读代码仓库时,最坏的结果通常是补丁写错;当它能控制整台电脑,风险就会扩大到文件、浏览器、Office、网络和系统设置。Moching 的价值在于把自然语言任务连接到真实桌面,但它也提...
最新内容
当 Agent 只读代码仓库时,最坏的结果通常是补丁写错;当它能控制整台电脑,风险就会扩大到文件、浏览器、Office、网络和系统设置。Moching 的价值在于把自然语言任务连接到真实桌面,但它也提...
“这个模型在 SWE-bench 上表现很好”,并不等于它能稳定修改你的单体仓库。不同项目的构建脚本、测试习惯、领域术语和隐藏约束差异很大。SelfBench 的思路是把团队自己的合并 PR 变成评测...
很多浏览器 Agent 的演示都很顺:打开一个临时浏览器,搜索网页,再把结果整理出来。但一旦任务需要登录企业后台、读取已经打开的页面,或者在提交表单前让人确认,问题就出现了:Agent 使用的是另一套...
很多浏览器 Agent 的演示都很顺:打开一个临时浏览器,搜索网页,再把结果整理出来。但一旦任务需要登录企业后台、读取已经打开的页面,或者在提交表单前让人确认,问题就出现了:Agent 使用的是另一套...
当 AI 编码 Agent 能一次生成数百行代码,真正稀缺的往往不是“写出来”,而是让人快速理解:它为什么这样设计、改动影响了什么、哪些决定是 Agent 自己做的。Whiteboard 选择了一个很...
当我们谈论 AI Agent 时,最常见的画面是它在终端里修改代码、调用 API,或者在浏览器中回答问题。但很多真实工作并不发生在一个终端窗口里:打开桌面应用、填写 Excel、操作网页、整理 PDF...
当 AI 编码 Agent 能一次生成数百行代码,真正稀缺的往往不是“写出来”,而是让人快速理解:它为什么这样设计、改动影响了什么、哪些决定是 Agent 自己做的。Whiteboard 选择了一个很...
让 Claude Code 或 Codex 重构项目,最烦的并不总是模型出错,而是电脑先睡着了。合上 MacBook 盖子去喝杯咖啡,Agent 可能随之暂停;Windows 的空闲睡眠也会让一段需要...
AI 编程 Agent 的成本,往往不是一次回答决定的。它会读取文件、运行测试、分析错误、修改代码,再重复几轮;真正消耗预算的是这些连续的中间步骤。把所有请求都交给最强模型当然简单,却会让大量“读日志...
当我们谈论 AI Agent 时,最常见的画面是它在终端里修改代码、调用 API,或者在浏览器中回答问题。但很多真实工作并不发生在一个终端窗口里:打开桌面应用、填写 Excel、操作网页、整理 PDF...