AI
1 分钟阅读
本地 RAG 不是只能二选一:用 embeddinggemma.c 把向量维度、接口兼容与硬件后端拆开
把检索增强生成(RAG)放到本地,最容易先被聊天模型吸走注意力;但真正决定检索链路延迟、索引体积和迁移成本的,往往是 embedding 服务。常见做法要么把一个通用推理框架常驻起来,要么把向量生成散...