RAG 语义缓存 2026:缓存答案而非 token,砍延迟砍成本

📘 教程 2026-08-13 约 6 分钟阅读

用户用一千种说法问同一个问题,每种说法都是一次完整 LLM 调用。语义缓存给相似查询返回已存答案——安全加装的方法在这里。

💡 你将学到

用户用一千种说法问同一个问题,每种说法都是一次完整 LLM 调用。语义缓存给相似查询返回已存答案——安全加装的方法在这里。

📜 目录

重复问题

生产环境 RAG 里,一小撮问题占大头:价格、退款、营业时间、上手引导。用户没完没了地换说法——意图相同、用词不同——每次换说法都触发完整管道:嵌入、检索、生成、token。语义缓存挡在前面:嵌入进来的查询、在相似度阈值内找到已存查询、返回缓存的答案。(star 数 2026-08-13 实测)

缓存在正确的层

有两层缓存,团队经常搞混:

Token 缓存(prompt 缓存):提供商缓存 prompt 的共享前缀。长而稳定的系统提示省成本;用户问题变了就省不了。

语义缓存(答案缓存):以查询嵌入为键缓存最终答案。对重复意图省掉整个管道。对客服型 RAG 收益更大,也是本篇的主角。

工具

GPTCache(8,130 stars):专用开源库。插进 LangChain 或裸 OpenAI 调用:嵌入查询、和缓存条目比相似度、命中就直接返回不调模型。相似度函数和存储(SQLite 到 Redis)都可配置。

vLLM 前缀缓存(88,283 stars):服务层的选项。用 vLLM 自托管时,自动前缀缓存跨请求复用共享前缀的 KV 缓存,重复对话模式的首 token 延迟大幅下降,应用代码零改动。

向量库 DIY:实用模式。Qdrant/Chroma 里放一个缓存集合;管道开始前查相似嵌入,生成后存答案。

安全规则

  1. 阈值纪律:阈值太低会返回错误答案。从余弦 0.92 起步,用真实流量调——衡量误命中,不只是命中率
  2. 缓存跟管道一起版本化:改了分块或模型就失效或分命名空间。过期答案比没缓存更糟
  3. 易变事实设 TTL:价格和政策答案要过期,长青答案可以长存。按条目设 TTL,别用一个全局策略
  4. 绝不缓存用户特定答案:含姓名、账号、个人信息的查询必须完全绕过缓存

预期收益

客服型 RAG 中 20% 的问题是重复的,语义缓存通常能砍掉 15-25% 的 LLM 调用,p95 延迟大幅下降——缓存路径完全跳过生成。实现一个下午,调优才是真功夫。

相关文章
2026-07-16
用AI Agent自动做代码审查:Git PR的智能审核助手
2026-07-17
AI Agent OpenAPI规范:API接口文档自动化
2026-07-16
2026年AI Agent项目GitHub Stars排行榜:最受欢迎的开源项目

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论