25GB 内存也能跑 744B MoE?Colibrì 的磁盘流式推理完全指南
本地跑大模型时,最常见的判断是:权重装不进显存或内存,就没有开始推理的资格。这个判断对稠密模型大多成立,但对 Mixture-of-Experts(MoE)模型并不完整。MoE 每个 token 只会...
最新内容
本地跑大模型时,最常见的判断是:权重装不进显存或内存,就没有开始推理的资格。这个判断对稠密模型大多成立,但对 Mixture-of-Experts(MoE)模型并不完整。MoE 每个 token 只会...
本地运行模型,最容易走进一个看似合理、实际代价很高的流程:先看到某个大模型的评测,再去猜自己的 Mac、显卡或工作站能不能跑。最后往往会在显存、统一内存、量化版本、上下文长度与速度之间反复试错。 To...
很多团队想把 AI 放进电话流程时,最先碰到的并不是「模型够不够聪明」,而是既有电话系统怎么接、语音链路如何排错、密钥与录音怎样留在自己的运行环境。直接把一个聊天接口接到 SIP 中继,通常会把音频传...
家里的智能音箱很擅长倒计时和播放音乐,却很少能处理真正的家庭协作:谁去接孩子、牛奶是否该补货、这周已经花了多少买菜钱。这不是模型「不够聪明」这么简单,而是多数语音助手没有共享的家庭上下文,也很难安全地...
问题现象:AI 开发者的「API 账单焦虑」 如果你在用 Claude Code、Cursor、Codex 这类 AI 编码工具,一定遇到过这种情况:月底账单显示 OpenAI API 调用花了 $2...
用 Claude Code、Cursor 或 Codex 写代码已经成为很多开发者的日常。一两分钟内,AI Agent 就能生成一个完整的数据看板、客户管理面板或内部 API。但等一下——这些应用跑在...
Google 在 I/O 2026 发布 Gemma 4 两周后,今天推出了 QAT(Quantization-Aware Training,量化感知训练) 版本。这不是简单的后训练量化——它在训练阶...
6 月 3 日,Google DeepMind 正式发布 Gemma 4 12B,在 Hacker News 上引发了超过 1050 点的社区讨论和近 400 条评论。这是 Gemma 系列中首个采用...
6 月 5 日,Google DeepMind 团队发布了 Gemma 4 系列的 QAT(Quantization-Aware Training,量化感知训练) 检查点,将旗舰模型的显存需求大幅降低...