服务

GPU 集群与 HPC

从硬件选型到调度与监控,交付一座可运维的集群;交付以文档与交接收尾。

工程实施指南

围绕作业,设计整座集群。

GPU 数量只是配置的一部分。数据如何进入、节点如何通信、作业如何恢复,决定这套系统是否真正可用。

先识别负载形态

以真实作业描述硬件需求,避免只按单卡规格采购。

多卡训练与微调
提供模型、精度、序列长度、并行方案和检查点频率;评估节点内互联、跨节点通信与检查点写入是否互相制约。
推理与批量计算
区分需要稳定响应的在线服务与可以排队的批任务,明确容量、隔离、调度优先级及故障后的恢复方式。
共享研究与 HPC 环境
列明用户、作业类型、软件栈和存储访问模式;以队列、配额、环境复现和运维权限确定集群使用规则。

计算、数据与控制一起设计

把物理拓扑与运行方式对应起来,使每个组件都有明确职责。

  1. 计算平面

    GPU、CPU、主存和节点内互联按作业配置;驱动与运行库版本进入交付清单,保留单节点基准。

  2. 数据平面

    分别规划数据集读取、缓存、检查点与归档,测量并发访问和恢复路径。网络带宽不能替代端到端数据供给验证。

  3. 控制平面

    配置作业队列、资源配额、监控和告警;确定节点下线、失败作业重试、维护窗口与管理员权限。

用作业验收,而不只看设备在线

验收用例和阈值在实施前确定,记录硬件、软件与测试条件。

节点与互联
检查设备识别、拓扑与链路状态;记录单节点和跨节点通信测试,定位异常链路。
代表性作业
运行约定的训练、推理或计算样例,检查吞吐、等待、显存使用、数据读取和失败记录。
恢复与交接
演练作业中断、检查点恢复、节点维护和监控告警;交付拓扑、配置、操作手册与责任边界。

规划前需要确认

集群方案必须适配实际场地与接管团队。

已有硬件可以继续使用吗?

先清点型号、显存、互联、存储、驱动和支持状态,再验证目标作业。异构设备是否混用,取决于调度和框架限制。

交付后由谁运维?

默认交接给客户团队。持续运维、值守、硬件维护与备件需要在服务范围中单独约定。

开始前提供什么?

作业样例与增长预期、现有资产、机房电力与散热条件、网络和存储限制、采购边界及接管人员。

4ROUTER / 系统研究

服务背后的技术依据

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
STATE / CAPACITY

KV cache:从张量形状到容量预算

上下文长度是一个随并发增长的状态预算。

TIERS / TRANSFER

LMCache:把 KV 状态放进存储层级

少算一次 prefill,要先付一次状态访问的成本。

SCHEDULING / SLO

从 Prefill 到 Decode:调度的实验设计

提升吞吐时,仍要知道谁在等待。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。