返回工程笔记

4ROUTER / 系统

搭建推理集群

从独立 GPU 到协同工作的推理服务。

工程笔记

先定义工作负载

集群规划从模型与请求开始。模型权重、上下文长度、同时活跃的请求和输出长度,共同决定显存需求。交互式应用关注首个 token 与后续生成的等待,离线任务更关注完成整批工作的时间。把两类任务放在同一资源池时,需要明确各自的优先级。

选择并行方式

模型能够装入单卡时,可以先验证单个副本的表现。模型跨卡运行时,张量并行或流水线并行引入通信和同步;增加卡数并不等同于同比增加吞吐。副本扩展与模型切分解决的是不同问题,应结合实际硬件互联分别测试。

把运行边界交接清楚

部署记录应包含模型版本、驱动与运行时版本、启动参数、健康检查和回滚入口。验收除了正常请求,还应覆盖长输入、取消请求、节点退出与容量不足。交接时说明哪些告警需要人工处理,以及重建副本需要哪些文件和权限。

实施前需要确认

  • 模型与输入输出分布
  • GPU 显存及节点互联
  • 负载隔离与故障处理

参考资料

vLLM · Parallelism and scaling

4ROUTER / 系统研究

深入机制与实验设计

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
GEMM / KERNELS

从算子到服务:cuBLAS 与 cuDNN

先识别限制执行的资源,再选择算子实现。

STATE / CAPACITY

KV cache:从张量形状到容量预算

上下文长度是一个随并发增长的状态预算。

TIERS / TRANSFER

LMCache:把 KV 状态放进存储层级

少算一次 prefill,要先付一次状态访问的成本。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。