手机内存装不下 60GB 模型怎么办?用 BigMoeOnEdge 把 MoE 专家按 Token 从闪存调进来
手机上的本地大模型,最常见的瓶颈不是 CPU 算得慢,而是权重根本放不进内存。尤其是 MoE(Mixture of Experts,混合专家)模型:文件可能有 18GB、60GB,甚至更大;但在生成一...
最新内容
手机上的本地大模型,最常见的瓶颈不是 CPU 算得慢,而是权重根本放不进内存。尤其是 MoE(Mixture of Experts,混合专家)模型:文件可能有 18GB、60GB,甚至更大;但在生成一...
家里已有 Frigate 摄像头时,常见的体验是:移动侦测和对象识别已经能产生大量事件,但信息仍碎成一段段通知。看到「检测到猫」以后,主人还得打开片段、判断是不是同一只、回忆今天是否喝水、有没有比平时...
很多产品里的“去背景”一开始只是一个按钮:上传图片,等云端返回一张透明 PNG。真正把它接入内容生产、商品图生成或视频处理流水线后,问题会变得具体:原图能否不离开本机?透明边缘是否可以保留而不是粗暴二...
本地运行大模型时,最常见的失败路径是先下载十几 GB 的 GGUF,再反复改 -ngl、上下文长度和量化等级。最后即使能启动,也未必知道瓶颈在显存、系统内存带宽、磁盘,还是模型的 MoE 专家层。更麻...
把检索增强生成(RAG)放到本地,最容易先被聊天模型吸走注意力;但真正决定检索链路延迟、索引体积和迁移成本的,往往是 embedding 服务。常见做法要么把一个通用推理框架常驻起来,要么把向量生成散...
AI 编程工作流一旦不止一个模型,真正难管的往往不是“能不能调用”,而是每一次调用到底走了谁、为什么走它、会不会把刚热起来的提示词缓存换掉。Claude Code、Codex 或自建脚本各自保存 Pr...
本地跑大模型时,最常见的判断是:权重装不进显存或内存,就没有开始推理的资格。这个判断对稠密模型大多成立,但对 Mixture-of-Experts(MoE)模型并不完整。MoE 每个 token 只会...
本地运行模型,最容易走进一个看似合理、实际代价很高的流程:先看到某个大模型的评测,再去猜自己的 Mac、显卡或工作站能不能跑。最后往往会在显存、统一内存、量化版本、上下文长度与速度之间反复试错。 To...
很多团队想把 AI 放进电话流程时,最先碰到的并不是「模型够不够聪明」,而是既有电话系统怎么接、语音链路如何排错、密钥与录音怎样留在自己的运行环境。直接把一个聊天接口接到 SIP 中继,通常会把音频传...
家里的智能音箱很擅长倒计时和播放音乐,却很少能处理真正的家庭协作:谁去接孩子、牛奶是否该补货、这周已经花了多少买菜钱。这不是模型「不够聪明」这么简单,而是多数语音助手没有共享的家庭上下文,也很难安全地...