群发资讯网

什么是LLM Stack? 我们平时说的“缓存”,其实可能指四种完全不同的东西:

什么是LLM Stack?
我们平时说的“缓存”,其实可能指四种完全不同的东西:KV Cache、Prefix Cache、Prompt Cache 和 Semantic Cache。前三种依赖精确的 Token 匹配,主要用来减少重复计算;语义缓存则是模糊匹配,虽然命中了,却不一定答得对。

这组图重点拆解了 KV Cache 如何随 Token 增长,以及 vLLM 如何通过分块、链式哈希、引用计数和 cache_salt,让不同请求复用相同的前缀计算。不过 Prefix Caching 只节省 Prefill,无法缩短 Decode;遇到缓存淘汰、低复用流量,或者文档顺序经常变化的 RAG,效果也会明显下降。

像 CacheBlend 这样的方案,会复用非前缀文档块,再选择性重算关键 Token。缓存并不是越多越好,真正重要的是:缓存了什么、按什么规则命中,以及命中之后还能不能保证结果正确。
大模型 AI人工智能 人工智能未来 算法 agent howto入门vibecoding AI工具 howto入门codex DeepSeek