AI
1 分钟阅读
手机内存装不下 60GB 模型怎么办?用 BigMoeOnEdge 把 MoE 专家按 Token 从闪存调进来
手机上的本地大模型,最常见的瓶颈不是 CPU 算得慢,而是权重根本放不进内存。尤其是 MoE(Mixture of Experts,混合专家)模型:文件可能有 18GB、60GB,甚至更大;但在生成一...