4ROUTER / 系统
搭建推理集群
从独立 GPU 到协同工作的推理服务。
工程笔记

先定义工作负载
集群规划从模型与请求开始。模型权重、上下文长度、同时活跃的请求和输出长度,共同决定显存需求。交互式应用关注首个 token 与后续生成的等待,离线任务更关注完成整批工作的时间。把两类任务放在同一资源池时,需要明确各自的优先级。
选择并行方式
模型能够装入单卡时,可以先验证单个副本的表现。模型跨卡运行时,张量并行或流水线并行引入通信和同步;增加卡数并不等同于同比增加吞吐。副本扩展与模型切分解决的是不同问题,应结合实际硬件互联分别测试。
把运行边界交接清楚
部署记录应包含模型版本、驱动与运行时版本、启动参数、健康检查和回滚入口。验收除了正常请求,还应覆盖长输入、取消请求、节点退出与容量不足。交接时说明哪些告警需要人工处理,以及重建副本需要哪些文件和权限。
实施前需要确认
- 模型与输入输出分布
- GPU 显存及节点互联
- 负载隔离与故障处理


