返回工程笔记

4ROUTER / 性能

优化推理路径

定位延迟、吞吐与资源占用之间的取舍。

工程笔记

先拆分等待时间

一次请求的等待可能发生在入口队列、提示词处理、逐 token 生成或网络传输。总耗时无法直接说明瓶颈。先记录请求到达、进入执行、首个 token 与完成的时点,再对照输入长度和输出长度分析。

保持可比较的负载

比较参数时保持模型、硬件、请求样本和到达模式一致。只看平均吞吐可能掩盖排队时间变长;只看单请求延迟又可能忽略并发场景。为交互和批处理分别定义可接受的等待,再判断优化是否符合使用目的。

一次验证一个改变

批处理上限、缓存策略、精度和算子实现都会改变资源使用。先建立基线,再记录每次改动和相同口径的测量。若涉及量化或算子替换,还要检查任务质量与数值行为,避免把输出变化误认为纯性能收益。

实施前需要确认

  • 延迟分段记录
  • 并发与请求到达模式
  • 性能和任务质量共同验收

参考资料

vLLM · Optimization and tuning

4ROUTER / 系统研究

深入机制与实验设计

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
GEMM / KERNELS

从算子到服务:cuBLAS 与 cuDNN

先识别限制执行的资源,再选择算子实现。

ATTENTION / MEMORY

FlashAttention 与 PagedAttention:不同层的内存问题

一个优化读写路径,一个组织持久状态。

SCHEDULING / SLO

从 Prefill 到 Decode:调度的实验设计

提升吞吐时,仍要知道谁在等待。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。