Back to blog

Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

面向快速视频生成的自洽分布匹配与缓存感知训练框架

Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

一、论文概述

项目内容
标题Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
作者Xingtong Ge, Yi Zhang, Yushi Huang, Dailan He, Xiahong Wang, Bingqi Ma, Guanglu Song, Yu Liu, Jun Zhang
论文arXiv:2604.03118
代码GitHub: XingtongGe/Salt
发布2026年4月3日

二、核心思想

问题定义

将视频生成模型蒸馏到极低推理预算(如 2-4 NFEs)对实时部署至关重要,但仍然具有挑战性。现有方法存在两个结构性瓶颈:

  1. DMD 的组合性缺陷 (Compositionality Deficit):分布匹配蒸馏 (DMD) 的训练信号是纯局部的——每个噪声级别独立监督,不显式约束去噪更新如何在时间步之间组合。这导致多步采样时误差累积,产生过曝和语义退化。

  2. 自回归生成中的 KV 缓存质量变化:在自回归视频生成中,每个新生成的 chunk 依赖之前 chunk 的 KV 缓存作为条件。缓存质量随推理步数变化(高步数 → 高质量缓存,低步数 → 噪声缓存),导致训练-推理分布不匹配。

解决方案概述

本文提出 Salt 框架,包含两个核心组件:

  1. SC-DMD (Self-Consistent Distribution Matching Distillation):在 DMD 基础上增加半群缺陷正则化器 (semigroup-defect regularizer),强制连续去噪更新的端点一致性,解决组合性缺陷。

  2. Cache-Condition-Aware Training:通过混合步数 rollout 和缓存条件参考对齐,系统性覆盖训练中遇到的各种缓存质量,提高自回归生成的鲁棒性。

三、技术架构

整体框架图

Salt 自回归视频生成架构概览

核心公式

基础:Flow Map 与半群性质

扩散/流匹配模型的概率流 ODE:

dxtdt=v(xt,t,c),t∈[0,1]\frac{dx_t}{dt} = v(x_t, t, c), \qquad t \in [0,1]

诱导的时间步到时间步传输算子(flow map):

xs=Φt→s(xt;c),0≤s<t≤1x_s = \Phi^{t \rightarrow s}(x_t; c), \qquad 0 \le s < t \le 1

精确 ODE flow map 满足半群(组合)律:

Φt→s=Φu→s∘Φt→u,∀ t>u>s\Phi^{t \rightarrow s} = \Phi^{u \rightarrow s} \circ \Phi^{t \rightarrow u}, \qquad \forall~t > u > s

DMD 的组合性缺陷

DMD 在采样的噪声级别上进行局部分布匹配监督:

∇θLDMD=Et,z[(∇xtlog⁡pf(xt,t)−∇xtlog⁡pr(xt,t))⋅∂xt∂θ]\nabla_\theta \mathcal{L}_{\text{DMD}} = \mathbb{E}_{t, z} \left[ (\nabla_{x_t} \log p_f(x_t, t) - \nabla_{x_t} \log p_r(x_t, t)) \cdot \frac{\partial x_t}{\partial \theta} \right]

问题:DMD 仅监督当前步的输出分布,不惩罚相邻更新在组合下的交互,导致多步推理时误差累积。

SC-DMD:半群缺陷正则化

给定三元组 (ts,tm,te)(t_s, t_m, t_e) 其中 ts>tm>tet_s > t_m > t_e,计算:

  • 直接(单步)端点:x^te(1)=Ψθts→te(xts)\hat{x}_{t_e}^{(1)} = \Psi_\theta^{t_s \rightarrow t_e}(x_{t_s})
  • 组合(两步)端点:x^te(2)=Ψθtm→te(Ψθts→tm(xts))\hat{x}_{t_e}^{(2)} = \Psi_\theta^{t_m \rightarrow t_e}(\Psi_\theta^{t_s \rightarrow t_m}(x_{t_s}))

自一致性损失:

LSC=E[∥x^te(1)−x^te(2)∥2]\mathcal{L}_{\text{SC}} = \mathbb{E} \left[ \| \hat{x}_{t_e}^{(1)} - \hat{x}_{t_e}^{(2)} \|^2 \right]

网格设计:在更细的训练网格 Ttrain\mathcal{T}_{\text{train}}(如 ∣Ttrain∣=8|\mathcal{T}_{\text{train}}| = 8)上训练,采样快捷三元组:

ts∈Ttrain,te∈Tinfer(K),tm∼Uniform(Ttrain∩(te,ts))t_s \in \mathcal{T}_{\text{train}}, \quad t_e \in \mathcal{T}_{\text{infer}}^{(K)}, \quad t_m \sim \text{Uniform}(\mathcal{T}_{\text{train}} \cap (t_e, t_s))

总训练目标:

L=LDMD+λSC⋅LSC\mathcal{L} = \mathcal{L}_{\text{DMD}} + \lambda_{\text{SC}} \cdot \mathcal{L}_{\text{SC}}

Cache-Condition-Aware Training

混合步数 Rollout:每次迭代采样 K∈{2,4,8}K \in \{2, 4, 8\},用对应调度运行 chunk-wise 自回归 rollout,暴露不同 rollout 保真度产生的 KV 缓存模式。SC-DMD 正则化仅在 K=8K=8 时激活(最长组合链)。

缓存条件参考对齐:对低质量缓存条件 (K∈{2,4}K \in \{2, 4\}) 的输出,向更高质量参考(2→42 \to 4, 4→84 \to 8)对齐。使用 TRD 风格的关系特征空间:

Rf(⋅)=zˉf(⋅)(zˉf(⋅))⊤∈RS×SR_f^{(\cdot)} = \bar{z}_f^{(\cdot)} (\bar{z}_f^{(\cdot)})^\top \in \mathbb{R}^{S \times S}

对齐损失(带 margin 松弛):

Lalign=1F∑f=1F[∥Rf(low)−Rf(ref)∥F2−δ]+\mathcal{L}_{\text{align}} = \frac{1}{F} \sum_{f=1}^{F} \left[ \| R_f^{(\text{low})} - R_f^{(\text{ref})} \|_F^2 - \delta \right]_+

完整自回归训练目标:

Ltotal=LDMD+λSC⋅LSC∣K=8+λalign⋅Lalign∣K∈{2,4}\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{DMD}} + \lambda_{\text{SC}} \cdot \mathcal{L}_{\text{SC}}|_{K=8} + \lambda_{\text{align}} \cdot \mathcal{L}_{\text{align}}|_{K \in \{2,4\}}

模型组件

组件说明关键参数
学生速度场 vθv_\theta几步去噪的参数化速度场与教师模型同架构
DMD 评判器 sψs_\psi匹配学生/教师分布的分数网络标准 DMD 交替更新
SC 正则化器半群缺陷惩罚,轻量级仅额外一次前向传播
缓存对齐模块TRD 风格特征关系匹配margin δ\delta

四、核心创新

创新点说明理论/实验依据
DMD 组合性缺陷识别首次系统识别 DMD 纯局部训练信号导致多步推理退化实验:增加训练步数(4→8→16)反而降低质量
SC-DMD 半群缺陷正则化用轻量级自一致性损失强制端点一致性组合DMD-8: 82.54 → SC-DMD: 83.19 (Total)
混合步数 Rollout采样 K∈{2,4,8}K \in \{2,4,8\} 覆盖不同缓存质量使 SC 正则化在 AR 设置中有效
缓存条件参考对齐低质量缓存输出向高质量参考对齐2-NFE: 84.63 → 84.80 (Total)
统一框架同时支持非自回归和自回归视频生成在多种骨干网络上一致改进

五、实验结果

非自回归少步蒸馏(Wan 2.1 14B I2V,4-NFE)

方法NFEI2V ScoreQualityBackg. Consist.Motion Smooth.Dynamic DegreeImaging Quality
PCM893.6378.5297.3498.2430.9870.42
DMD493.0978.8992.7997.9958.4670.35
LightX2V493.5080.9295.8797.8960.3371.67
Salt (Ours)493.9080.8695.9798.3752.8572.16
Salt-α493.8881.7195.4698.3068.1372.08

5 秒视频生成 VBench(Wan 2.1 1.3B)

模型参数分辨率NFETotalQualitySemantic
扩散模型
rCM1.3B832×480482.7383.6579.04
DMD1.3B832×480482.7884.3976.36
SC-DMD (Ours)1.3B832×480483.1984.4278.30
SC-DMD (Ours)1.3B832×480282.8584.0678.01
自回归模型
CausVid1.3B832×480481.2084.0569.80
Self Forcing1.3B832×480484.2084.7482.05
Salt-Self Forcing1.3B832×480484.4785.2781.28
LongLive1.3B832×480484.4085.1281.53
Salt-LongLive1.3B832×480484.9385.4183.00
Causal Forcing1.3B832×480484.6285.4181.47
Salt-Causal Forcing1.3B832×480485.0885.9681.59

30 秒自回归生成 VBench-Long

模型TotalQualitySemanticSubject Consist.Temp. Flicker.Motion Smooth.
Causal Forcing 系列
Causal Forcing78.1182.5760.2596.2995.4797.67
Salt-Causal Forcing78.2882.1562.7797.1696.9598.32
LongLive 系列
LongLive79.0382.8263.8897.3696.6298.16
Salt-LongLive79.2782.9064.7497.2896.9298.29

消融实验

SC-DMD 消融(Wan 2.1 1.3B T2V,4 步推理)

方法QualitySemanticTotalSpatial Rel.Multi-ObjectsObject ClassImaging Q.
DMD-884.0576.5082.5467.1378.9893.4765.46
DMD-484.3976.3682.7869.4979.3793.2364.73
SC-DMD84.4278.3083.1972.3285.7295.1666.40

关键发现:单纯增加训练网格密度(DMD-4 → DMD-8)并不能改善少步生成,反而导致质量退化。SC-DMD 通过半群缺陷正则化一致提升所有指标。

自回归训练组件消融(Causal Forcing)

方法NFEQualitySemanticTotal
Causal Forcing (baseline)485.4181.4784.62
+ naive LSC\mathcal{L}_{\text{SC}}484.3581.7783.83
+ mixed-step + LSC\mathcal{L}_{\text{SC}}485.9181.4885.02
Salt (full)485.9681.5985.08
+ mixed-step + LSC\mathcal{L}_{\text{SC}}285.6280.6584.63
Salt (full)285.6381.4984.80

关键发现:

  1. 直接在 AR 设置中加 LSC\mathcal{L}_{\text{SC}} 反而损害性能(84.62 → 83.83)
  2. 混合步数 rollout 是 SC 正则化在 AR 设置中生效的必要条件
  3. 参考对齐在低预算 (2-NFE) 时更有帮助

六、与现有方法对比

训练轨迹对比

不同少步蒸馏方法的训练轨迹对比

方法训练信号类型组合性约束分布匹配
一致性蒸馏轨迹级回归隐式(端点一致性)无
Shortcut Models组合一致性显式(自蒸馏)无
Flow Map 蒸馏连续半群律显式(主要目标)无
DMD局部分布匹配无显式
SC-DMD (Salt)分布匹配 + 半群正则显式(正则化器)显式

DMD 组合性缺陷可视化

DMD 组合性缺陷:4/8/16 步 DMD 学生的首帧、中间帧和末帧

跨步数一致性对比

相同 seed 和 prompt 下的跨步数一致性:DMD vs SC-DMD

七、相关工作

方向代表工作与 Salt 的关系
一致性蒸馏LCM, PCM轨迹级回归,缺乏分布匹配
DMD 系列DMD, DMD2, DMD-XSalt 的基础,解决其组合性缺陷
Flow Map 蒸馏AYF连续半群约束,Salt 用作正则化器
Shortcut ModelsSD3.5组合一致性自蒸馏,Salt 借鉴思想
实时视频生成Self Forcing, Causal Forcing, LongLiveSalt 的 AR 骨干网络

八、总结

核心贡献

  1. 识别 DMD 组合性缺陷:首次系统证明 DMD 的纯局部训练信号无法约束多步推理的组合一致性
  2. SC-DMD 框架:用轻量级半群缺陷正则化器(仅一次额外前向传播)解决组合性缺陷
  3. 缓存条件感知训练:混合步数 rollout + 参考对齐,覆盖自回归生成中的 KV 缓存质量变化
  4. 统一框架:在非自回归(Wan 2.1)和自回归(Self Forcing, Causal Forcing, LongLive)设置上一致改进
  5. 跨步数鲁棒性:SC-DMD 在 2/4/8 步推理下均保持一致质量,而非仅优化单一操作点

技术影响

  • 为少步视频生成蒸馏提供了新的正则化范式
  • 半群缺陷正则化思想可推广到其他序列生成任务
  • 缓存条件感知训练对自回归扩散模型有广泛适用性
  • 统一的非自回归/自回归框架降低了方法迁移成本

局限性

  • 代码尚未发布(承诺将发布)
  • SC-DMD 仅在 K=8K=8 时激活,对更长组合链的扩展性待验证
  • 参考对齐依赖启发式调度,可能需要针对不同任务调优
  • 计算开销:SC-DMD 增加一次前向传播,混合步数 rollout 增加训练复杂度

九、参考资源

  • 论文: arXiv:2604.03118
  • 代码: GitHub: XingtongGe/Salt
  • 关键引用:
    • DMD (Distribution Matching Distillation)
    • Wan 2.1 (骨干视频生成模型)
    • Self Forcing / Causal Forcing / LongLive (自回归实时视频生成)

分析日期: 2026-06-05