返回工程笔记

4ROUTER / 弹性服务

随负载扩展

让容量变化与请求行为相匹配。

工程笔记

先选择有意义的信号

GPU 利用率描述设备活动,但不直接表示调用方等待。队列长度、等待时间、活跃请求和生成速度提供不同视角。扩容规则需要说明使用哪些信号,以及为何它们能够反映当前工作负载。

扩容有滞后

指标被采集、规则被执行、资源被调度、模型被加载,都需要时间。在突发流量到来后才扩容,可能无法解决已经形成的等待。容量计划需要同时考虑热资源、队列上限和过载时的响应。

缩容先处理在途工作

缩容时先停止给目标副本分配新工作,并说明在途请求如何结束。长生成任务可能影响关闭时间。反复扩缩会浪费加载成本,也会增加运行波动,因此策略需要稳定窗口与明确的最低容量。

实施前需要确认

  • 工作负载信号
  • 启动时间与资源余量
  • 排空和稳定窗口

参考资料

Kubernetes · Horizontal autoscaling

4ROUTER / 系统研究

深入机制与实验设计

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
GEMM / KERNELS

从算子到服务:cuBLAS 与 cuDNN

先识别限制执行的资源,再选择算子实现。

STATE / CAPACITY

KV cache:从张量形状到容量预算

上下文长度是一个随并发增长的状态预算。

TIERS / TRANSFER

LMCache:把 KV 状态放进存储层级

少算一次 prefill,要先付一次状态访问的成本。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。