返回工程笔记

4ROUTER / 系统

跨 GPU 调度

把任务放到合适的资源上。

工程笔记

资源数量只是起点

一个任务需要几张卡,还不足以说明它该在哪里运行。显存、GPU 类型、互联、模型缓存和其他任务的占用都会影响放置。将这些条件记录为调度约束,比依赖人工记住机器差异更容易维护。

明确隔离单位

Kubernetes 通过设备插件暴露 GPU 资源,并通过资源请求与限制参与调度。应用仍需管理模型内部的并发与显存使用。节点级的放置决策与推理引擎内部的请求调度处于不同层级,应分别观察。

为排队保留解释

任务没有运行时,应能区分缺少资源、约束不满足、镜像或模型加载、以及节点异常。明确队列策略和取消流程,防止重试把同一工作反复提交。维护节点时也要说明作业是迁移、重建还是等待。

实施前需要确认

  • GPU 类型与显存
  • 放置约束及队列策略
  • 维护与取消流程

参考资料

Kubernetes · Schedule GPUs

4ROUTER / 系统研究

深入机制与实验设计

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
GEMM / KERNELS

从算子到服务:cuBLAS 与 cuDNN

先识别限制执行的资源,再选择算子实现。

STATE / CAPACITY

KV cache:从张量形状到容量预算

上下文长度是一个随并发增长的状态预算。

TIERS / TRANSFER

LMCache:把 KV 状态放进存储层级

少算一次 prefill,要先付一次状态访问的成本。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。