news 2026/9/12 2:33:00

LiteLLM 缓存:4 步把重复 LLM 调用的成本打下来

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LiteLLM 缓存:4 步把重复 LLM 调用的成本打下来

LiteLLM 缓存:4 步把重复 LLM 调用的成本打下来

【免费下载链接】litellmThe fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]项目地址: https://gitcode.com/GitHub_Trending/li/litellm

LiteLLM 是一个统一接入 100+ LLM API 的开源 AI 网关,它的响应缓存是其中性价比最高的一项优化:对重复请求直接返回已存的结果,不再二次调用上游模型,延迟和账单同时下降。本文按 4 步带你从零用起来 LiteLLM 缓存。

什么时候需要响应缓存

先判断你的场景值不值得做。假设一个客服机器人,「什么时候发货」一天被问 3000 次,答案却永远一样——每次都打模型,等于为同一答案付费 3000 遍。规则很简单:输入相同、输出稳定的请求,就该走缓存;而创意写作这类生成任务,缓存意义有限。记住一句话:问答靠缓存,创作别硬套

最快开启 LiteLLM 缓存的方式

最快路径就是两行代码:给litellm.cache赋一个 Cache 对象,然后照常发起调用:

import litellm from litellm import Cache litellm.cache = Cache(type="local") response = litellm.completion( model="gpt-4o", messages=[{"role": "user", "content": "我的订单什么时候发货?"}], )

第一次调用会命中模型并存档,第二次同样的请求直接从缓存返回,延迟从几百毫秒掉到毫秒级 ⚡。type="local"表示内存缓存,零依赖、即开即用,但进程重启就清空,适合开发调试。生产环境换成 Redis 即可:

litellm.cache = Cache(type="redis", host="localhost", port=6379)

缓存后端怎么选

各种后端实现都放在 litellm/caching/ 目录里,选型只看一个问题:你跑几台机器、数据放哪?

  • local:内存缓存,最快,单机器开发首选。
  • redis:生产标配,多实例共享同一份缓存。
  • disk:写入本地磁盘,重启不丢,适合单机长期任务。
  • s3:对象存储,分布式部署和跨机房场景顺手。
  • dual:同时写内存和 Redis,内存命中最快,Redis 兜底不丢。

结论:单进程开发用 local,多实例生产用 redis 或 dual,不用纠结。

语义缓存:不只抓相同文字,还抓相近意思

精确匹配有个硬伤:「旗舰款卖多少钱」和「新品价格是多少」文字不同、意图相同,却都不会命中缓存。语义缓存的做法是把问题转成向量(一组能代表语义的数字)再和历史问题比对,similarity_threshold参数控制严格程度,设 0.95 表示语义相似度达到 95% 才返回缓存。启用前需要配一个嵌入(embedding)模型。对问答类应用,语义缓存能明显抬高命中率;阈值越高风险越低,建议从 0.95 起步,边观察边调。

缓存有效期怎么控制

一条缓存活多久,由 TTL(time-to-live,存活时间)决定。如果问题的答案会随时间变化——比如价格调整、活动结束——旧缓存反而会误导用户。初始化时把ttl设成秒数,例如 3600,到期自动失效、重新计算。结论:变动内容必须显式设 TTL;相对静态的知识可以放宽甚至不设。

LiteLLM 缓存命中率怎么看

开启后盯三个数:命中率(多少请求被缓存直接拦下)、避免的调用次数(大致等于省下的钱)、延迟下降幅度。网关的管理后台还提供审计日志与费用记录,可以对照核对每次请求的来源与花费:

收尾:4 步落地路径

第 1 步,开 local 缓存验证场景是否值得;第 2 步,切到 Redis 让多实例共享;第 3 步,问答产品加语义缓存,把命中率再抬一截;第 4 步,按内容时效设好 TTL,持续盯命中率。缓存本质是在新鲜度和成本之间做取舍,把这两头守住,账单自然会稳定降下来。

【免费下载链接】litellmThe fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]项目地址: https://gitcode.com/GitHub_Trending/li/litellm

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 16:33:03

twenty开源CRM完整实用指南:自托管部署、数据模型定制与应用扩展

twenty开源CRM完整实用指南:自托管部署、数据模型定制与应用扩展 【免费下载链接】twenty The open alternative to Salesforce, designed for AI. 项目地址: https://gitcode.com/GitHub_Trending/tw/twenty 本文写给准备自建客户管理系统的开发和运维同学&…

作者头像 李华
网站建设 2026/9/4 16:22:35

箱子和托盘目标检测数据集:用YOLO解决仓储视觉痛点

简介:本资源是面向物流与工业自动化领域的多类别目标检测数据集,专为YOLO等主流检测模型训练优化,解决仓储场景中箱子与托盘两类核心载体的精准识别问题,适用于AGV导航、机械臂抓取、智能分拣及供应链可视化等实际落地任务。压缩包…

作者头像 李华
网站建设 2026/9/5 19:09:37

Cloudflare Kitesurf 解析:为 AI Agent 打造的智能体浏览器

这次我们来看一个 Cloudflare 刚刚放出来的新项目:Kitesurf。它不是又一个 AI 对话助手,也不是给普通用户换皮肤的浏览器,而是一个专门为 AI 智能体(AI Agent)设计的浏览器。简单说,Kitesurf 的定位是把浏览…

作者头像 李华
网站建设 2026/9/2 1:57:56

Windows 11 提速怎么做:系统精简 3 档操作清单

Windows 11 提速怎么做:系统精简 3 档操作清单 【免费下载链接】Win11Debloat A simple, lightweight PowerShell script that allows you to remove pre-installed apps, disable telemetry, as well as perform various other changes to declutter and customize…

作者头像 李华
网站建设 2026/9/2 4:36:04

TouchGFX控件交互扩展:Mixin机制原理与Draggable/Clickable实战

做嵌入式GUI开发,尤其是用TouchGFX的时候,我估计每个人都遇到过这么一件事:控件画出来了,功能却不够用。默认的Button只能响应点击,默认的TextArea只能显示文本,想把一个文本框拖到别的位置,想让…

作者头像 李华
网站建设 2026/9/3 17:27:59

补齐工业具身智能中间层,让机器人从量产走向量销

把机器人从“量产”推到“量销”,工业具身智能的中间层是绕不开的一仗。工业具身智能这个词这两年越来越频繁地出现在技术社区和产业会议里,但很多人的理解还停留在“给机械臂加上视觉、让AGV学会导航、给机器人装一个大模型”这个层面。真正在产线上跑过…

作者头像 李华