4ROUTER / AI INFRASTRUCTURE

AI 基础设施, 围绕你的工作负载。

从多模型推理到训练调优,从 GPU 集群到私有化部署。用合适的模型、算力与部署方式,把 AI 带入你的业务。

4ROUTERINFRASTRUCTURE, IN PRACTICE.

THE PLATFORM

从一个端点开始。

保留熟悉的调用方式,把模型接入、路由决策和用量管理交给同一套平台。

connect.pyPython
from openai import OpenAI
import os

client = OpenAI(
    base_url=os.environ["FOURROUTER_BASE_URL"],
    api_key=os.environ["FOURROUTER_API_KEY"]
)

models = client.models.list()

OpenAI 兼容接口

熟悉的 SDK,更多模型选择。

更换一个 base_url 即可接入;一个端点背后是完整的模型池。

接入文档

请求路径示意

你的请求任务 · 质量 · 成本
Enthalpy匹配模型
通用模型推理模型专用模型

Enthalpy 路由引擎

让模型选择跟随任务。

Enthalpy 是 4Router 的自研路由引擎,结合任务需求、模型能力与成本约束做出选择。

引擎的技术细节 →

用量有据可查

请求与用量逐条记录,方便核对调用和费用。

访问集中管理

通过控制台管理账户与访问入口,按工作空间分配权限。

能力与服务

从推理到部署,覆盖你的工作。

直接接入平台,或与我们一起搭建专属基础设施。

INFERENCE

让模型服务于真实应用。

通过统一端点接入多模型推理,或在专有环境中部署模型服务。按任务需求配置模型、容量与调用边界。

推理服务详情 →

统一模型接入

通过兼容接口连接多家供应商,减少应用侧的重复集成。

专有推理环境

根据模型、并发与数据要求,配置专属推理服务。

TRAINING & OPTIMISATION

让模型更适合你的任务。

面向具体任务开展模型微调、评测与算子优化。先明确质量与运行要求,再选择训练和调优路径。

训练与调优详情 →

微调与评测

围绕业务数据与任务目标开展微调,以一致口径评估效果。

算子与运行性能

从模型执行到 kernel 实现,分析瓶颈并进行针对性优化。

你的环境,你的基础设施

基础设施,也可以由你掌握。

需要自有算力或明确的数据边界时,我们把工作延伸到集群和部署现场。

GPU 集群与 HPC

从硬件选型到调度与监控,交付可运维的集群。

  • 集群搭建
  • 调度与监控
  • 运维交接
集群与 HPC 详情 →

私有化部署

在企业指定的环境部署模型与服务,并明确数据、访问、更新和运维的边界。

  • 私有 LLM 服务
  • 数据边界
  • 持续支持
私有化部署详情 →

4ROUTER / 系统研究

把配置选择,放回系统原理。

理解算子、KV 状态与调度怎样共同决定一条推理路径。

在 Resources 中阅读系统笔记
GEMM / KERNELS

从算子到服务:cuBLAS 与 cuDNN

先识别限制执行的资源,再选择算子实现。

ATTENTION / MEMORY

FlashAttention 与 PagedAttention:不同层的内存问题

一个优化读写路径,一个组织持久状态。

TIERS / TRANSFER

LMCache:把 KV 状态放进存储层级

少算一次 prefill,要先付一次状态访问的成本。

4ROUTER / ENGINEERING

基础设施内部。

聊聊你的基础设施需求。

接入平台,或讨论模型、性能与部署方案。