57GB 跑 204B MoE 代码模型并不只是压缩:MoEspresso 如何在 Apple Silicon 上管理专家、上下文与本地 API
大模型的本地部署常被简化成“选一个更小的量化文件”。但对 MoE(Mixture of Experts,混合专家)模型而言,文件大小只是第一道门槛:路由器会在每个 token 上选择少数专家,而权重怎...
最新内容
大模型的本地部署常被简化成“选一个更小的量化文件”。但对 MoE(Mixture of Experts,混合专家)模型而言,文件大小只是第一道门槛:路由器会在每个 token 上选择少数专家,而权重怎...
语音转文字常被误当成一个“选模型”的问题:挑一个识别率更高的云 API,再把音频传过去。但在客户访谈、内部复盘、招聘面试或含代码讨论的会议里,真正先需要回答的问题往往是:音频是否可以离开办公室?谁保留...
ERP(企业资源计划)软件常常在两个方向之间拉扯:一端是功能齐全、部署和定制成本也很高的大型系统;另一端则是由表格、SaaS 和脚本拼接出来的业务流程。Celerp 选择了另一个值得开发者关注的方向:...
手机上的本地大模型,最常见的瓶颈不是 CPU 算得慢,而是权重根本放不进内存。尤其是 MoE(Mixture of Experts,混合专家)模型:文件可能有 18GB、60GB,甚至更大;但在生成一...
家里已有 Frigate 摄像头时,常见的体验是:移动侦测和对象识别已经能产生大量事件,但信息仍碎成一段段通知。看到「检测到猫」以后,主人还得打开片段、判断是不是同一只、回忆今天是否喝水、有没有比平时...
很多产品里的“去背景”一开始只是一个按钮:上传图片,等云端返回一张透明 PNG。真正把它接入内容生产、商品图生成或视频处理流水线后,问题会变得具体:原图能否不离开本机?透明边缘是否可以保留而不是粗暴二...
本地运行大模型时,最常见的失败路径是先下载十几 GB 的 GGUF,再反复改 -ngl、上下文长度和量化等级。最后即使能启动,也未必知道瓶颈在显存、系统内存带宽、磁盘,还是模型的 MoE 专家层。更麻...
把检索增强生成(RAG)放到本地,最容易先被聊天模型吸走注意力;但真正决定检索链路延迟、索引体积和迁移成本的,往往是 embedding 服务。常见做法要么把一个通用推理框架常驻起来,要么把向量生成散...
AI 编程工作流一旦不止一个模型,真正难管的往往不是“能不能调用”,而是每一次调用到底走了谁、为什么走它、会不会把刚热起来的提示词缓存换掉。Claude Code、Codex 或自建脚本各自保存 Pr...
本地跑大模型时,最常见的判断是:权重装不进显存或内存,就没有开始推理的资格。这个判断对稠密模型大多成立,但对 Mixture-of-Experts(MoE)模型并不完整。MoE 每个 token 只会...