Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms
重新审视自回归与扩散的二分法,提出推理时扩展的两个轴:序列扩展和状态精炼
Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms |
| 作者 | Jiaming Song, Linqi Zhou |
| 机构 | Luma AI (部分工作) |
| 论文 | https://arxiv.org/abs/2503.07154 |
| 代码 | 无 |
| 发布 | 2025-03-10 (v1), 2026-06-01 (v3) |
| 许可 | CC BY 4.0 |
二、核心思想
核心论点:打破虚假二分法
生成式预训练通常被框定为自回归模型处理离散信号与扩散模型处理连续信号之间的二分法。作者认为这种二分法是虚假的,因为它混淆了四个不同的概念:
- 模型族 (Model Family):Transformer、U-Net 等
- 数据表示 (Data Representation):离散 token vs 连续 token
- 训练目标 (Training Objective):交叉熵 vs 扩散风格目标
- 推理过程 (Inference Procedure):自回归 vs 状态精炼
更清晰的二分法
更有意义的对比是:
| 维度 | 离散 token | 连续 token |
|---|---|---|
| 训练目标 | 交叉熵损失 | 扩散风格目标 |
| 推理过程 | 序列扩展 (Sequence Expansion) | 状态精炼 (State Refinement) |
- 自回归是一种推理过程,通过归一化条件抽取扩展序列
- 扩散是一种精炼过程,反复修订现有状态
核心主张
先设计推理算法,再设计训练目标。因为训练方法无法补偿一个省略必要参数或施加不正确因子化的推理映射。
推理时扩展的两个轴
- 序列扩展 (Sequence Expansion):逐步生成新 token(通常与自回归关联)
- 状态精炼 (State Refinement):反复修订现有状态(通常与扩散关联)
这两个轴并非互斥,可以组合使用(如 blockwise 或混合方法)。
三、三个关键例证
例证 1:DDIM 的目标时间限制
问题:DDIM 风格的采样器在目标时间步上存在容量限制。
分析:
- 速度场 定义了无穷小更新
- DDIM 的单步迭代过程对目标时间步的容量有限
- 当前去噪网络设计下,模型无法充分利用目标时间信息
最小修复:将目标时间步加入去噪网络的输入。
结果:这一修复 + 适当的矩匹配目标 (Inductive Moment Matching, IMM) → 稳定的单阶段算法,在样本质量上超越扩散模型,推理效率提升超过一个数量级。
关键洞察:这些想法不依赖于去噪分数匹配或基于分数的随机微分方程。
例证 2:多 token 预测的联合分布限制
问题:多 token 预击 (Multi-Token Prediction, MTP) 在联合分布上存在限制。
分析:
- 标准的 next-token prediction 因果因子化限制了并行性
- 当剩余 masked token 更接近条件独立时,masked diffusion 可以扩展并行性
- MTP 的当前 workaround 无法完全释放状态精炼的扩展潜力
相关工作:
- LLaDA:前向 masking 过程,预测 masked token
- Block Diffusion:自回归生成块,块内去噪
- Diffusion Forcing:自回归结构 + 序列内去噪
例证 3:流映射和少步蒸馏
核心问题:高效的少步生成器应该学习两时间传输映射,而非仅无穷小速度场。
流映射程序 (Boffi, Albergo, Vanden-Eijnden):
- 速度场 定义无穷小更新
- 流映射直接表示从 到目标时间 的两时间传输算子
- 少步生成器应学习长程传输映射
后续发展:
- 流映射 (Flow Maps)
- 快捷模型 (Shortcut Models)
- 均值流 (Mean Flows)
- 轨迹分布匹配 (Trajectory Distribution Matching)
- 连续或分类扩散语言模型
语言建模证据:
- LangFlow:通过连接嵌入空间扩散与流匹配,使连续扩散语言模型与离散扩散竞争
- Block Diffusion:自回归生成块 + 块内去噪
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| 打破虚假二分法 | 分离模型族、数据表示、训练目标、推理过程 | 概念分析 |
| 两轴框架 | 序列扩展 + 状态精炼 | 统一视角 |
| 先推理后训练 | 推理算法设计应优先于训练目标 | DDIM 限制分析 |
| DDIM 目标时间限制 | 发现并修复 DDIM 的容量瓶颈 | +IMM → 10× 效率提升 |
| 流映射视角 | 少步生成应学习两时间传输映射 | 统一 flow/shortcut/mean flow |
五、相关工作整合
连续空间方法
| 方法 | 类型 | 关键特点 |
|---|---|---|
| DDIM | 扩散采样器 | 目标时间限制,需修复 |
| Rectified Flow | 流匹配 | 直线化传输路径 |
| IMM | 矩匹配 | 单阶段,10× 效率 |
| Flow Maps | 传输映射 | 两时间参数化 |
| Shortcut Models | 少步生成 | 长程推理移动 |
| Mean Flows | 轨迹匹配 | 直接参数化 |
离散/语言空间方法
| 方法 | 类型 | 关键特点 |
|---|---|---|
| LLaDA | 离散扩散 | 前向 masking,指令调优 |
| Block Diffusion | 混合 | 自回归块 + 块内去噪 |
| Diffusion Forcing | 混合 | 自回归结构 + 序列去噪 |
| LangFlow | 连续扩散 | 嵌入空间 + 流匹配 |
六、总结
核心贡献
- 概念框架:将生成式预训练分解为四个独立维度
- 两轴推理:序列扩展 + 状态精炼的统一视角
- 设计原则:先设计推理算法,再设计训练目标
- 三个例证:DDIM 限制、MTP 限制、流映射证据
- 前瞻指引:为生成式预训练算法设计提供方向
技术影响
- 理论清晰:消除了自回归 vs 扩散的混淆
- 设计指导:推理时扩展应成为算法设计的核心考量
- 统一视角:连接了 flow matching、distillation、diffusion 等不同方向
- 实践价值:IMM 等方法验证了理论的正确性
局限性
- 这是一篇立场论文 (position paper),主要提供概念框架而非具体方法
- 部分论点基于后续工作的”事后验证”
- 离散空间的状态精炼仍是一个开放问题
七、参考资源
- 论文: https://arxiv.org/abs/2503.07154
- 关键引用:
- DDIM: Denoising Diffusion Implicit Models
- IMM: Inductive Moment Matching
- Flow Maps: Boffi, Albergo, Vanden-Eijnden
- LLaDA: Large Language Diffusion Model
- Block Diffusion: 自回归 + 块内去噪
- LangFlow: 连续扩散语言模型