Back to blog

RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems

基于哈密顿分解的电路交换网络架构,支持超大规模 LLM 训练的灵活、可扩展、低成本互连

RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems

一、论文概述

项目内容
标题RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems
作者Yinxiao Feng, Tiancheng Chen, Yuchen Wei, Siyuan Shen, Shiju Wang, Wei Li, Kaisheng Ma, Torsten Hoefler
机构鹏城实验室、Tencent AI Lab、ETH Zurich、清华大学
论文arXiv:2507.18889
代码无公开代码(含模拟器)
发布2025-07-25
许可arXiv 非独占分发许可
规模25 页,21 张图,6 张表

二、核心思想

问题定义

随着 LLM 规模持续增长(如 LLaMA-3 405B 需要 16K H100 GPU),传统网络架构面临三大挑战:

网络架构核心问题
Fat-Tree高基数交换机昂贵,扩展到超大规模时成本急剧上升
Torus二分带宽不足,无法支持 All-to-All 通信(如 MoE)
HammingMesh本地带宽受限,路由跳数多

核心矛盾:现有拓扑在可扩展性、二分带宽、成本三者之间无法同时最优。

解决方案概述

RailX 提出了一种基于**哈密顿分解(Hamiltonian Decomposition)**的电路交换网络架构,通过三个核心创新解决上述挑战:

  1. Rail-Ring 互连:利用哈密顿分解将完整图的边分配到 k-1 个 rail 环上,构建超大规模 All-to-All 拓扑
  2. 2D 组织电路交换:节点和光开关物理上 2D 排列,支持超过 100K 芯片的平面交换层
  3. 维度分裂(Dimension Splitting):灵活分配带宽到不同并行维度(TP/CP/EP/DP/PP)

三、技术架构

整体框架图

RailX架构概览

RailX 的物理架构分为三个层次:

┌─────────────────────────────────────────────────────────────────┐
│                    RailX Physical Architecture                  │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  ┌─────────────┐  ┌─────────────┐  ┌─────────────┐            │
│  │   Chip      │  │   Node      │  │   System    │            │
│  │  (m×m mesh) │──│ (r×r OCS)   │──│ (R/2 × R/2) │            │
│  └─────────────┘  └─────────────┘  └─────────────┘            │
│                                                                 │
│  Layer 1: 芯片内     Layer 2: 节点间     Layer 3: 系统级         │
│  2D-mesh 高带宽      光电路交换          2D 排列                 │
│  (UCIe/UALink)      (OCS)              (R²/4 × R²/4 节点)     │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

核心创新:Rail-Ring 互连

Rail-Ring互连

哈密顿分解定理(Lemma 3.1):

给定一个具有 k-1 个 rail 的节点(每个 rail 有 +/- 两个端口),k 个节点的 All-to-All 拓扑可以通过 k-1 个 rail 环构建。任意两个节点 (A,B) 在两个不同的 rail 环 ra 和 rb 上直接连接。

关键性质:

  • 直径短:仅 2 个 hop 即可到达任意节点
  • 二分带宽高:支持 All-to-All 通信
  • 可扩展:k 个节点需要 k-1 个 rail

拓扑配置

拓扑配置

RailX 支持三种基础拓扑配置:

拓扑可扩展性直径二分带宽适用场景
2D-Torus(R/2)²m²R16n/(Rm)All-Reduce 流量
2D-HyperX(r+1)²m²22n/mAll-to-All 流量
Dragonfly(r+1)(R/2)m²32n/m混合流量

高维异构并行映射

高维并行映射

RailX 支持 5D 异构并行(TP × CP × EP × DP × PP),通过维度分裂灵活分配带宽:

节点 rail 分配示例(n=9, r=63):
┌─────────────────────────────────────────┐
│  X-rail (63 rails):                      │
│  ├── TP: 2 rails (最内层,最高带宽)       │
│  ├── CP: 4 rails                         │
│  └── DP: 1 rail                          │
│  Y-rail (63 rails):                      │
│  ├── EP: 8 rails                         │
│  └── PP: 1 rail                          │
└─────────────────────────────────────────┘

通信算法

点对点路由

路由

RailX 在 HyperX 拓扑上使用最小路由算法,额外需要在本地 2D-mesh 上路由。关键性质:

  • 路由跳数:最多 2(m/2-1) + (m-1) 内部跳
  • 无死锁:通过增加虚拟通道数(VC = do + 1)
  • 支持确定性和自适应路由

集合通信

All-Reduce

2D-Ring-based All-Reduce:

T2D-Ring≈4mpα+V2nBT_{\text{2D-Ring}} \approx 4mp\alpha + \frac{V}{2nB}

其中:

  • p: 处理器数量
  • α: 光学跳延迟
  • V: 数据量
  • nB: 每芯片边总带宽

层次化 All-Reduce:

  • 本地 2D-mesh 上使用双向环
  • 全局使用 2D-ring 算法
  • 充分利用芯片内高带宽

映射与调度

Expert并行

静态分配

目标:最小化实际训练时间

TActual≈TComp+max⁡{TComp∗,TComm∗}+TCommT_{\text{Actual}} \approx T_{\text{Comp}} + \max\{T_{\text{Comp}}^*, T_{\text{Comm}}^*\} + T_{\text{Comm}}

其中 TComp*/TComm* 是可与计算重叠的通信时间。

动态分配

电路交换动态分配

利用电路交换的可重构性,在训练迭代间动态调整带宽分配:

  • CP 和 EP 通信不重叠,间隔约几毫秒
  • 可在训练过程中重新配置 OCS
  • 两个通信均可独占一个物理维度的全部带宽

四、核心发现

成本对比

拓扑规模成本每注入带宽成本全局带宽成本比
2-Tier Fat-Tree2,048$415.9M1×1×
1:3 Tapered FT3,072$395.7M0.65×1.90×
TPUv44,096$185.7M0.22×5.52×
RailX4Mesh65,536$751.1M0.06×0.45×
RailX7Mesh200,704$1,314.4M0.03×0.45×
4-Tier Fat-Tree196,608$83,718M2.10×2.10×

关键发现:

  • RailX 每注入/All-Reduce 带宽成本不到 Fat-Tree 的 10%
  • RailX 每二分/All-to-All 带宽成本不到 Fat-Tree 的 50%
  • 仅需 ~$1.3B 即可互连 200K 芯片,带宽达 1.8TB

All-to-All 性能

All-to-All性能

  • RailX 达到 0.8 flits/cycle/chip 吞吐量,接近理论最大值 1.0
  • 在 1.3K 芯片规模下,比其他拓扑具有更高的成本效益
  • 内部带宽是关键:2× 内部带宽即可接近最优性能

All-Reduce 性能

All-Reduce性能

  • 层次化 2D-Torus 算法在 RailX 上始终表现最佳
  • 大规模 All-Reduce:各算法接近带宽最优
  • 小规模 All-Reduce:层次化算法显著优于 1D-ring

带宽分配探索

带宽分配

  • 小序列长度:更多带宽分配给 DP
  • 大序列长度:更多带宽分配给 CP
  • 考虑计算/通信重叠后,应进一步增加 CP 带宽

可靠性与可用性

可靠性

  • 故障节点导致行和列断开
  • 最大可用规模随故障节点数线性下降
  • 典型故障率 0.1% 时,可用性 >90%
  • 支持 MLaaS 场景下的灵活调度

五、实验设置

评估方法

方法说明
分析模型硬件验证的分析模型,估计计算和通信
周期级模拟器基于 CNSim 框架,支持微架构建模
Trace 合成由分析模型生成通信流量

模拟器配置

参数值
外部带宽1 flit/cycle(64 Gb/s)
内部带宽k × 外部带宽
缓冲区大小16 flits/VC
外部延迟10 cycles
内部延迟1 cycle

成本模型

组件价格
400G 被动铜缆$250
400G 有源光收发器$1,000
64 端口 400G 包交换机$35K
128 端口 OCS$35K

六、核心创新

创新点说明理论/实验依据
哈密顿分解互连k-1 个 rail 环构建 All-to-AllLemma 3.1,图论基础
2D 组织 OCS节点和光开关 2D 排列支持 100K+ 芯片
维度分裂灵活分配带宽到并行维度支持 5D 异构并行
电路交换动态重配训练迭代间调整拓扑CP/EP 动态带宽分配
层次化集合通信本地 2D-mesh + 全局 2D-ring充分利用高带宽

七、相关工作对比

工作拓扑成本可扩展性本文差异
Fat-Tree (NVIDIA DGX)树状高中RailX 成本 <10%
TPUv43D-Torus+OCS中中RailX 2D 组织,更高带宽
HammingMesh2D-mesh低中RailX 内部带宽更高
TopoOpt可重构中中RailX 基于哈密顿分解

八、总结

核心贡献

  1. 提出 RailX 网络架构:基于哈密顿分解的电路交换网络,支持超大规模 LLM 训练
  2. 实现极低成本:每注入/All-Reduce 带宽成本不到 Fat-Tree 的 10%
  3. 支持灵活并行:维度分裂方法支持 5D 异构并行的灵活映射
  4. 验证超大规模:支持超过 200K 芯片的互连,仅需 ~$1.3B
  5. 支持 MLaaS:电路交换允许灵活调度和故障绕过

技术影响

  • 成本优化:为超大规模 LLM 训练提供经济高效的网络解决方案
  • 架构创新:哈密顿分解理论在网络设计中的首次应用
  • 产业应用:可指导下一代 AI 集群的网络架构设计
  • 学术价值:建立了拓扑理论与实际网络设计的桥梁

局限性

  • 电路交换延迟:OCS 重配置需要毫秒级时间,不适合细粒度动态调整
  • 故障影响:2D 组织导致故障节点影响整行整列
  • 实现复杂度:哈密顿分解的物理布线可能增加制造难度
  • 成本估算:基于公开价格,实际成本可能有偏差
  • 未实测:评估基于模拟器,未在真实硬件上验证

九、参考资源

  • 论文: arXiv:2507.18889
  • 相关系统:
  • 关键理论:
    • Hamiltonian Decomposition (Tillson, 1980) - 图论基础
    • HyperX (Ahn et al., 2009) - k-D 拓扑
    • Dragonfly (Kim et al., 2008) - 低直径拓扑
  • 相关论文:
    • Rail-Only (Wang et al., 2024) - 2D Fat-Tree
    • TopoOpt (Wang et al., 2023) - 拓扑优化
    • CASSINI (Rajasekaran et al., 2024) - 调度方法