8GB 显卡能学到什么:用最小实验拆开 SFT、DPO 与 GRPO 的后训练边界
大模型后训练常被描述成只有实验室才做得起的工作:数据、GPU 集群、复杂的分布式训练脚本,缺一不可。但如果目标不是训练一个可上线的通用模型,而是理解一次训练究竟改变了什么,实验规模可以小得多。 poc...
最新内容
大模型后训练常被描述成只有实验室才做得起的工作:数据、GPU 集群、复杂的分布式训练脚本,缺一不可。但如果目标不是训练一个可上线的通用模型,而是理解一次训练究竟改变了什么,实验规模可以小得多。 poc...
本地运行大模型时,最常见的失败路径是先下载十几 GB 的 GGUF,再反复改 -ngl、上下文长度和量化等级。最后即使能启动,也未必知道瓶颈在显存、系统内存带宽、磁盘,还是模型的 MoE 专家层。更麻...
把检索增强生成(RAG)放到本地,最容易先被聊天模型吸走注意力;但真正决定检索链路延迟、索引体积和迁移成本的,往往是 embedding 服务。常见做法要么把一个通用推理框架常驻起来,要么把向量生成散...
AI 编程工作流一旦不止一个模型,真正难管的往往不是“能不能调用”,而是每一次调用到底走了谁、为什么走它、会不会把刚热起来的提示词缓存换掉。Claude Code、Codex 或自建脚本各自保存 Pr...
本地跑大模型时,最常见的判断是:权重装不进显存或内存,就没有开始推理的资格。这个判断对稠密模型大多成立,但对 Mixture-of-Experts(MoE)模型并不完整。MoE 每个 token 只会...
在终端里向模型问“把这个目录的日志按日期归档”“找出最近两小时失败的任务”,通常比记住一串 find、awk、xargs 更快。但把自然语言直接变成可执行 Shell,又恰好踩在自动化最危险的边缘:模...
本地运行模型,最容易走进一个看似合理、实际代价很高的流程:先看到某个大模型的评测,再去猜自己的 Mac、显卡或工作站能不能跑。最后往往会在显存、统一内存、量化版本、上下文长度与速度之间反复试错。 To...
痛点:你的 AI 编码助手真的「懂」你的代码吗? Claude Code、Cursor、Codex 这些 AI 编码 Agent 很强大,但有一个根本问题:它们不理解你的代码库。 它们能写新代码、改现...
你有没有遇到过这种情况:本地跑了个大模型,装了 Open WebUI 或 LibreChat,界面很漂亮,但它除了聊天什么也做不了——不能打开你的文件、不能操作浏览器、不能帮你自动化日常工作。另一边,...
场景:你的 Agent 被自己的工具淹没了 想象一下这个场景:你给 Claude Code 或 Codex 注册了 50 个 MCP 工具——文件操作、搜索、网络请求、数据库查询、代码分析、Git 操...