2026年10月7日 1 分钟阅读

手机和电脑上的 AI Agent 如何真正协作?nanoMuse 把审批、记忆与自托管放进同一个项目

tinyash 0 条评论

很多个人 Agent 的体验停留在“聊天窗口”:能回答问题,却不能持续执行任务;能调用工具,却无法安全地触碰手机和电脑。nanoMuse 试图解决的是另一类问题:让同一个个人 Agent 分布在手机、桌面端、浏览器和自托管服务器之间,并在删除、发送、付款等不可逆操作前停下来征求确认。

这个项目最近在 Hacker News 上获得关注,GitHub 仓库采用 GPL-3.0-or-later。官方 README 当前列出的版本是 0.1.40 Clear,仓库同时包含手机应用、桌面应用、Web 控制台和连接设备的 relay,而不是只提供一个聊天前端。

它和普通聊天机器人有什么不同?

nanoMuse 的核心不是“模型更聪明”,而是把 Agent 的执行边界做成了产品的一部分。

首先,它可以操作 Linux shell、浏览器、MCP 服务器和技能;启用 Hands 后,还能通过手机或电脑的屏幕完成那些没有 API 的操作。登录或 CAPTCHA 等需要人介入的环节会交还给用户,完成后 Agent 再继续执行。

其次,审批是显式机制。删除文件、发送内容或付款前,Agent 会暂停;用户可以选择只允许本次对话、允许当前工作区,或者拒绝。密码和验证码仍由用户输入,这比把长期凭据交给一个后台进程更容易审计。

再次,设备之间不是各自维护一份孤立会话。README 给出的示例是,在消息开头使用 @Mac 把任务发往 Mac;手机可以发起任务,桌面端执行,审批再回到手边的设备。项目文档还说明,文本对话通过 relay 传递,而文件和截图留在生成它们的设备上。

先用起来:浏览器、桌面端和自托管

如果只是体验,官方提供了浏览器演示。需要本地运行时,可以从 GitHub Releases 下载 Android APK、macOS、Windows 或 Linux 版本。桌面端覆盖 macOS 12+、Windows 10+ 和 Linux x64;README 特别提示,macOS 下载包未 notarise,首次打开需要右键选择“打开”。

项目也提供了明确的自托管入口。下面的命令来自仓库 README:

bash scripts/self-host.sh --local
docker compose up -d app

前者用于启动自己的 relay,后者用于在服务器上启动 Web app。不要把这理解成“所有数据自动留在本地”:设备间的对话仍可能经过你配置的 relay,实际部署前应阅读项目的隐私和 self-hosting 文档,确认网络边界、模型密钥以及日志保留策略。

记忆为什么值得关注?

nanoMuse 没有把记忆描述成一个不可见的向量数据库,而是把“它是什么、知道什么、何时醒来”等内容放在可读写的 Markdown 文件中。这个选择对开发者很友好:你可以检查 Agent 到底记住了什么,也可以通过版本控制或普通文本编辑器修正错误记忆。

它还提供 Goals、routines 和 feed:任务可以按计划检查,例程可以在应用关闭时运行,feed 则把结果整理成日常信息流。这样的设计更像一个持续运行的个人自动化系统,而不是每次都要重新提示的聊天机器人。

模型和许可证边界

项目支持 relay 提供的用量,也支持用户自己的模型密钥。README 列出了包括 Bailian、OpenRouter、OpenAI、Gemini 和 DeepSeek 在内的多家提供商,并提到可以使用 ChatGPT、Claude 或 Kimi 等已有方案。不同提供商的图像、视频能力并不相同,应用会在能力不可用时关闭对应功能。

需要注意的是,nanoMuse 的当前许可证是 GPL-3.0-or-later,手机端基于 OpenMinis,桌面端使用 DeepSeek Harness 等上游组件。它是开源项目,但并不意味着所有第三方模型或 relay 用量都免费;自托管时仍要承担服务器和模型调用成本。

适合哪些场景?

如果你经常在手机上发现任务、在电脑上执行任务,或者希望让 Agent 定时整理信息,nanoMuse 的跨设备设计比单一桌面聊天工具更有吸引力。它也适合希望保留本地控制权、又不想从零拼装手机端、桌面端、审批层和 relay 的开发者。

但它仍然是一个快速演进的社区项目。0.1.40 的 release notes 仍在修复输入框、更新重启、屏幕截图和 relay 控制台等具体问题;对于付款、删除和生产环境自动化,建议先在测试工作区验证,并把不可逆操作保持在人工审批之后。

nanoMuse 的价值不在于宣称“Agent 可以替你做一切”,而在于把三个经常被分开讨论的问题放到了一起:Agent 如何跨设备到达任务现场,如何在危险动作前停下来,以及如何让记忆和部署边界保持可见。对于正在构建个人 Agent 工作流的人来说,这比又一个聊天 UI 更值得观察。

相关链接

发表评论

你的邮箱地址不会被公开,带 * 的为必填项。