4ROUTER / 系统
跨 GPU 调度
把任务放到合适的资源上。
工程笔记

资源数量只是起点
一个任务需要几张卡,还不足以说明它该在哪里运行。显存、GPU 类型、互联、模型缓存和其他任务的占用都会影响放置。将这些条件记录为调度约束,比依赖人工记住机器差异更容易维护。
明确隔离单位
Kubernetes 通过设备插件暴露 GPU 资源,并通过资源请求与限制参与调度。应用仍需管理模型内部的并发与显存使用。节点级的放置决策与推理引擎内部的请求调度处于不同层级,应分别观察。
为排队保留解释
任务没有运行时,应能区分缺少资源、约束不满足、镜像或模型加载、以及节点异常。明确队列策略和取消流程,防止重试把同一工作反复提交。维护节点时也要说明作业是迁移、重建还是等待。
实施前需要确认
- GPU 类型与显存
- 放置约束及队列策略
- 维护与取消流程


