4ROUTER / 性能
理解 KV Cache
生成过程中的状态,如何占用与复用显存。
工程笔记

缓存保存什么
自回归生成会反复关注已经处理过的上下文。KV Cache 保存注意力机制使用的键和值,减少后续生成对已有上下文的重复计算。它属于请求运行状态,与模型权重是不同的显存占用来源。
为什么采用分块管理
不同请求的长度和完成时间不同,连续预留大块显存可能产生浪费。分块管理把逻辑上的连续上下文映射到多个物理块。具体的块大小、回收与复用机制取决于推理实现,应结合实际负载观察。
复用需要边界
相同前缀不代表任何情况下都可以复用缓存。模型版本、输入 token、位置和运行配置等条件需要匹配;多租户系统还要明确缓存的隔离策略。评估缓存时同时观察命中情况、显存占用和请求等待。
实施前需要确认
- 上下文长度分布
- 显存预算与回收行为
- 前缀复用及隔离边界


