Back to blog

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

从 128K 到 4M:高效训练超长上下文大语言模型

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

一、论文概述

项目内容
标题From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models
作者Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro
机构UIUC, NVIDIA
论文arXiv:2504.06214
代码GitHub: ultralong
发布2025年4月
许可开源

二、核心思想

问题定义

长上下文能力对多种应用至关重要:

  • 文档和视频理解
  • 上下文学习
  • 推理时缩放

挑战:

  • 现有模型上下文窗口有限
  • 扩展上下文长度需要高效训练策略
  • 需要保持标准任务性能

解决方案概述

UltraLong 提出高效的超长上下文 LLM 训练方案:

  1. 阶段 1:继续预训练:扩展上下文窗口到 1M/2M/4M tokens
  2. 阶段 2:指令调优:维持指令跟随和推理能力

关键技术:

  • 特殊文档分隔符
  • YaRN-based RoPE 缩放
  • 高效数据组成

三、技术架构

整体框架图

训练流水线

UltraLong 遵循两阶段训练:

阶段职责关键技术
继续预训练扩展上下文窗口特殊分隔符,YaRN RoPE
指令调优维持能力高质量 SFT 数据

核心公式

YaRN-based RoPE 缩放

RoPE 缩放因子:

s=目标上下文长度基础上下文长度s = \frac{\text{目标上下文长度}}{\text{基础上下文长度}}

配置:

  • α = 1, β = 4(固定)
  • 1M: s = 128
  • 2M: s = 256
  • 4M: s = 512

效果:更大的缩放因子缓解性能退化。

数据准备与文档连接

策略:

  • 下采样 <4K tokens 文档
  • 上采样 >8K tokens 文档
  • 最终语料:1B tokens

文档分隔:

  • 使用特殊字符而非保留 token
  • 不应用跨文档注意力掩码
  • 允许模型关注整个输入序列

优势:更有效、更高效地适应超长上下文。

模型组件

组件说明关键参数
基础模型Llama-3.1-8B-Instruct128K 上下文
RoPE 缩放YaRN-basedα=1, β=4
上下文并行CP=4 (1M), CP=16 (2M/4M)TP=8
训练数据长上下文语料1B tokens

训练流程

继续预训练

配置说明
目标长度1M, 2M, 4M tokens
RoPE 缩放s=128, 256, 512
数据量1B tokens,1 epoch
学习率3×10⁻⁵
GPU256 NVIDIA H100
训练时间1M: 5h, 2M: 6h, 4M: 13h

指令调优

数据组成:

  • 通用领域
  • 数学领域
  • 代码领域

策略:

  • 高质量短上下文 SFT 数据
  • 保持指令跟随和推理能力

四、核心创新

创新点说明理论/实验依据
高效训练方案从 128K 扩展到 4M tokens仅需 1B tokens
特殊文档分隔符替换保留 token更有效的上下文适应
YaRN RoPE 缩放更大的缩放因子缓解性能退化
一步策略优于多步策略一致的性能提升
平衡改进长短上下文均提升标准基准保持竞争力

五、实验结果

实验设置

配置说明
基础模型Llama-3.1-8B-Instruct
上下文长度128K, 1M, 2M, 4M
评估基准RULER, LV-Eval, InfiniteBench
标准基准MMLU, MATH, GSM-8K, HumanEval

Needle-in-a-Haystack 测试

Llama-3.1 基线

UltraLong-1M

UltraLong-2M

UltraLong-4M

关键发现:

  • UltraLong 在所有长度下保持高准确率
  • 4M 模型在 4M 长度下仍有效
  • 相比基线有显著改进

长上下文基准

RULER 评估:

  • UltraLong 在所有长度下优于基线
  • 在 1M+ 长度下优势更明显

LV-Eval 评估:

  • 在多文档问答任务上表现优异
  • 长上下文理解能力显著提升

InfiniteBench 评估:

  • 在超长上下文任务上达到 SOTA
  • 在 128K+ 长度下超越现有模型

标准基准

基准Llama-3.1-8BUltraLong-8B
MMLU竞争力保持
MATH竞争力保持
GSM-8K竞争力保持
HumanEval竞争力保持

结论:扩展上下文不损害标准任务性能。

与现有方法对比

特性UltraLongProLongGradientChatQA 2
最大长度4M512K1024K128K
训练数据1B40B+--
训练时间5-13h长长-
标准性能保持退化退化保持
长上下文SOTA好中等好

六、消融实验

关键设计选择

文档分隔符:

  • 特殊字符 > 保留 token
  • 全注意力 > 跨文档掩码

RoPE 缩放:

  • YaRN > NTK-aware
  • 更大缩放因子更好

训练策略:

  • 一步 > 多步
  • 更高效,性能更好

数据组成:

  • 长上下文数据上采样
  • 短文档下采样

七、相关工作

上下文扩展方法

方法关键特性局限性
PI位置插值需要微调
NTK-aware频率缩放性能退化
YaRN综合缩放参数选择
LongLoRA稀疏注意力近似方法
LM-Infinite有限注意力近似方法

长上下文 LLMs

模型关键特性局限性
GPT-4o128K 上下文闭源
Gemini超长上下文闭源
ProLong512K 开源计算昂贵
Gradient1024K标准性能退化

八、总结

核心贡献

  1. 高效训练方案:从 128K 扩展到 4M tokens
  2. 关键技术:特殊分隔符 + YaRN RoPE
  3. 一步策略:优于多步策略
  4. SOTA 性能:长上下文基准最佳
  5. 平衡改进:长短上下文均提升

技术影响

  • 效率:仅需 1B tokens 和 5-13 小时训练
  • 可扩展性:支持 4M tokens
  • 实用性:保持标准任务性能
  • 开源:发布所有模型权重

局限性

  • 模型规模:仅评估 8B 参数模型
  • 数据量:1B tokens 可能不够充分
  • 评估范围:未覆盖所有长上下文任务
  • 计算成本:4M 模型需要 13 小时训练

九、参考资源