返回工程笔记

4ROUTER / 性能

理解 KV Cache

生成过程中的状态,如何占用与复用显存。

工程笔记

缓存保存什么

自回归生成会反复关注已经处理过的上下文。KV Cache 保存注意力机制使用的键和值,减少后续生成对已有上下文的重复计算。它属于请求运行状态,与模型权重是不同的显存占用来源。

为什么采用分块管理

不同请求的长度和完成时间不同,连续预留大块显存可能产生浪费。分块管理把逻辑上的连续上下文映射到多个物理块。具体的块大小、回收与复用机制取决于推理实现,应结合实际负载观察。

复用需要边界

相同前缀不代表任何情况下都可以复用缓存。模型版本、输入 token、位置和运行配置等条件需要匹配;多租户系统还要明确缓存的隔离策略。评估缓存时同时观察命中情况、显存占用和请求等待。

实施前需要确认

  • 上下文长度分布
  • 显存预算与回收行为
  • 前缀复用及隔离边界

参考资料

vLLM · Paged attention

4ROUTER / 系统研究

深入机制与实验设计

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
STATE / CAPACITY

KV cache:从张量形状到容量预算

上下文长度是一个随并发增长的状态预算。

ATTENTION / MEMORY

FlashAttention 与 PagedAttention:不同层的内存问题

一个优化读写路径,一个组织持久状态。

PREFIX / REUSE

RadixAttention:复用前缀,不是复用答案

复用的单位是具有一致计算历史的前缀状态。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。