服务

训练与调优

围绕你的任务开展模型微调、训练流程与运行性能优化。以可复现的基线开始,以明确的交付物和验收记录结束。

训练案例

Enthalpy 的公开案例包含模型池测量、Stage 1 打分头训练与留出集评测。实测页同时保留早期失败、跨池限制和 Stage 2 试运行记录。

实测 →

工程实施指南

从任务基线到可复现的交付。

模型质量、运行效率与训练基础设施是不同的问题。先找准要改变的指标,再决定数据、训练与优化路径。

选择调优路径

使用同一批代表性任务定位问题,避免把所有不足都归结为模型参数。

回答不符合任务要求
检查数据覆盖、标签一致性、提示方式与评分标准,再评估微调或对齐。保留未参与训练和方案选择的验收集。
结果正确,但运行太慢
分析算子、显存、数据搬运和批处理行为。性能调优需要同时检查数值一致性,不能只比较最理想输入下的吞吐。
实验多,难以复现和恢复
整理环境锁定、数据版本、配置、检查点与训练日志;先让已有实验可回放,再扩大训练规模。

一次完整的调优循环

每轮实验都应能回答:改了什么、为什么改、结果如何、能否回退。

  1. 定义数据与基线

    固定数据来源、去重与划分方法、评分规则和参考模型;同时记录质量、运行时间及资源消耗。

  2. 执行受控实验

    分别记录数据、训练参数与运行时的变更;保留失败实验。训练方式和硬件规模根据模型、授权与预算确定。

  3. 留出集验证与打包

    按预先约定的指标验收,附带不利样本、限制与回退方式。将权重或适配器、配置和运行说明一起交接。

交付的不只是权重

项目范围确定后,交付材料应足以支持复跑、上线判断与后续维护。

数据与实验清单
数据版本、来源及使用范围、划分策略、环境依赖、关键参数、随机种子和实验记录。
模型或优化实现
约定范围内的检查点、适配器或性能改动,以及加载说明、兼容条件和回退版本。
比较报告
与原始基线使用相同测试条件;列出质量差异、运行开销、失败类别及不可外推的部分。

范围与验收先说清楚

公开案例说明我们如何测量;你的任务仍需要自己的基线。

Enthalpy 的案例能说明什么?

公开的正向结果来自 CodeRouterBench 上的 Stage 1 检查点。Stage 2 仅有试运行记录;跨模型池结果并不支持普遍迁移收益。详见完整实测。

微调是否一定优于现有模型?

不预设结论。先用任务集确认差距与可接受的退化范围;没有通过验收的改动不应被包装成上线成果。

准备哪些材料?

基座模型与授权条件、训练和验收样本、业务评分规则、现有运行环境、资源预算,以及你希望保留的能力。

4ROUTER / 系统研究

服务背后的技术依据

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
GEMM / KERNELS

从算子到服务:cuBLAS 与 cuDNN

先识别限制执行的资源,再选择算子实现。

ATTENTION / MEMORY

FlashAttention 与 PagedAttention:不同层的内存问题

一个优化读写路径,一个组织持久状态。

STATE / CAPACITY

KV cache:从张量形状到容量预算

上下文长度是一个随并发增长的状态预算。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。