Back to blog

Lance: Unified Multimodal Modeling by Multi-Task Synergy

轻量级原生统一多模态模型,通过双流MoE架构和多任务协同训练实现图像视频理解、生成与编辑

Lance: Unified Multimodal Modeling by Multi-Task Synergy

论文信息: arXiv:2605.18678 [cs.CV] 18 May 2026

项目主页: https://lance-project.github.io

代码仓库: https://github.com/bytedance/Lance


一、论文概述

1.1 研究背景

多模态人工智能正日益走向原生统一范式,将理解、推理和生成集成在一个统一框架中。然而,现有系统仍沿着两条独立路径发展:理解模型强调语义推理和指令遵循,而生成模型专注于视觉合成和时空动态。

现有统一模型的两大局限:

局限说明
视觉表征不匹配理解需要高层语义特征,生成需要低层连续表征
任务覆盖不足大多数方法局限于文本-图像领域,视频任务覆盖不完整

1.2 核心贡献

贡献说明
双流 MoE 架构理解专家和生成专家解耦,共享多模态上下文
MaPE 位置编码模态感知旋转位置编码,缓解异构视觉 token 干扰
分阶段多任务训练PT → CT → SFT → RL 四阶段渐进式训练
全面任务覆盖支持 X2T、X2I、X2V 全任务空间,展现涌现泛化能力

1.3 一句话总结

Lance 是一个轻量级(3B 参数)原生统一多模态模型,通过双流 MoE 架构和多任务协同训练,在图像/视频生成上显著超越现有开源统一模型,同时保持强大的多模态理解能力。


二、核心思想

2.1 设计原则

┌─────────────────────────────────────────────────────────────────┐
│                    Lance 设计原则                                 │
├─────────────────────────────────────────────────────────────────┤
│  1. 统一上下文建模 (Unified Context Learning)                     │
│     • 交错多模态序列建模                                          │
│     • 多任务协同优化                                             │
│                                                                 │
│  2. 解耦能力路径 (Decoupled Capability Pathways)                 │
│     • 理解专家:自回归语言建模                                     │
│     • 生成专家:Flow Matching                                    │
│     • 语义视觉 token vs 生成潜在 token                            │
└─────────────────────────────────────────────────────────────────┘

2.2 关键技术问题

问题现有方案的局限Lance 解决方案
视觉表征统一表征难以兼顾语义和生成双流表征:ViT 语义 + VAE 潜在
参数共享共享骨干导致理解与生成竞争双流 MoE:专用专家容量
位置编码标准 3D-RoPE 无法区分异构 tokenMaPE:模态感知位置偏移
训练策略单阶段训练难以平衡多任务四阶段渐进式训练

三、技术架构

3.1 整体架构

Lance Architecture Overview 图 7:模态感知旋转位置编码 (MaPE) 示意

核心组件:

组件说明关键参数
ViT EncoderQwen2.5-VL 视觉编码器14× 空间 + 2× 时间 patching
VAE EncoderWan2.2 3D 因果 VAE16× 空间 + 4× 时间下采样
LLM_UND理解专家基于 Qwen2.5-VL 初始化
LLM_GEN生成专家基于 Qwen2.5-VL 初始化
LM Head自回归语言建模头Next-token prediction
Flow HeadFlow 预测头速度预测

3.2 核心公式

统一多模态序列: \mathcal{S} = \dots \oplus \mathcal{B}_{\text{text}}(\mathbf{T}) \oplus \mathcal{B}_{\text{vis}}(\mathbf{V}_{\text{vit}}) \oplus \mathcal{B}_{\text{vis}}(\mathbf{V}_{\text{vae}}^{\text{clean}}) \oplus \mathcal{B}_{\text{vis}}(\mathbf{V}_{\text{vae}}^{\text{noisy}}) \oplus \dots \tag{1}

理解损失函数: \mathcal{L}_{\text{UND}} = -\sum_i \log p_{\theta_{\text{UND}}}(y_i \mid y_{<i}, \mathcal{S}) \tag{3}

生成损失函数 (Flow Matching): \mathcal{L}_{\text{GEN}} = \mathbb{E}_{x_0, x_1, t}\left[\|v_{\theta_{\text{GEN}}}(x_t, \mathcal{S}, t) - (x_1 - x_0)\|_2^2\right] \tag{4}

总目标函数: \mathcal{L} = \lambda_u \mathcal{L}_{\text{UND}} + \lambda_g \mathcal{L}_{\text{GEN}} \tag{5}

MaPE 位置编码: \mathbf{p}_{t,h,w}^{(m_i)} = \hat{\mathbf{p}}_{t,h,w}^{(m_i)} + [i \cdot \Delta_t, 0, 0] \tag{7}

3.3 模型组件

双流 MoE 架构:

┌─────────────────────────────────────────────────────────────────┐
│                    Lance 双流 MoE 架构                           │
├─────────────────────────────────────────────────────────────────┤
│  Input: 交错多模态序列 (Text + ViT + VAE_clean + VAE_noisy)      │
│                                                                 │
│  ┌─────────────────────┐    ┌─────────────────────┐            │
│  │   LLM_UND (理解)     │    │   LLM_GEN (生成)     │            │
│  │  • 文本 token        │    │  • VAE 潜在 token    │            │
│  │  • ViT 语义 token    │    │  • 条件 token        │            │
│  │  • 自回归预测        │    │  • Flow 速度预测     │            │
│  └──────────┬──────────┘    └──────────┬──────────┘            │
│             │                          │                        │
│             ▼                          ▼                        │
│        LM Head                    Flow Head                     │
│    (Next-token pred)         (Velocity pred)                   │
└─────────────────────────────────────────────────────────────────┘

3.4 训练流程

四阶段渐进式训练:

阶段目标数据量学习率训练步数
PT基础多模态对齐1.5T tokens1.0×10⁻⁴350K
CT多任务空间扩展300B tokens1.0×10⁻⁴80K
SFT指令遵循优化72B tokens2.5×10⁻⁵15K
RL图像生成优化0.5B tokens2.0×10⁻⁶800

数据混合策略:

阶段视频生成视频理解图像生成图像理解
PT64%16%16%4%
CT64%16%16%4%
SFT64%16%16%4%

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
双流 MoE理解与生成专家解耦,共享上下文避免参数竞争,提升任务性能
MaPE模态感知位置编码缓解异构 token 干扰,提升对齐
分阶段训练PT→CT→SFT→RL 渐进式逐步构建能力,平衡多任务
涌现泛化未见任务的零样本泛化广泛任务覆盖带来泛化能力

4.2 技术亮点

1. MaPE 位置编码:

  • 仅在时间维度添加模态偏移 Δt\Delta_t
  • 保持空间坐标不变,保留图像/视频空间结构
  • 显式区分 ViT 语义、VAE 条件、VAE 目标 token

2. 分阶段训练策略:

  • PT:大规模配对数据建立基础能力
  • CT:渐进增加编辑、主体驱动生成等挑战性任务
  • SFT:高质量数据优化指令遵循
  • RL:GRPO 优化文本渲染和图文对齐

3. 任务特定系统提示:

  • 理解任务:引导详细描述和问答
  • 生成任务:引导视觉特征描述和指令遵循
  • 编辑任务:引导输入分析和修改生成

五、实验结果

5.1 图像生成基准

DPG-Bench 和 GenEval 结果:

模型参数量DPG-BenchGenEval
PixArt-α0.6B76.960.48
SDXL3.5B80.410.55
SD3-Medium2B84.080.74
FLUX.1-dev12B83.840.82
Qwen-Image20B88.320.87
Lance (Ours)3B84.670.90

关键发现:

  • Lance(3B)在 GenEval 上超越所有统一模型,达到 0.90 整体分数
  • 在 DPG-Bench 上达到 84.67,与更大模型竞争
  • 特别在计数(0.84)、颜色(0.97)、位置(0.87)任务上表现优异

5.2 视频生成基准

VBench 结果:

模型参数量整体质量语义质量时序一致性
HunyuanVideo8.3B80.275.378.5
Wan2.2-TI2V5B76.872.174.2
UniVideo7B78.573.876.1
Lance (Ours)3B82.578.280.1

关键发现:

  • Lance 在视频生成上全面超越更大参数量的模型
  • 时序一致性得分 80.1,显著优于竞争方法
  • 物理感知生成能力(重力、流体动力学)表现突出

5.3 多模态理解基准

任务LanceInternVL-UBagel
图像描述85.283.784.1
视觉问答78.676.377.2
推理任务72.370.171.5

关键发现:

  • Lance 在保持强大生成能力的同时,理解能力未受损害
  • 多任务协同训练带来理解与生成的正向迁移

5.4 消融实验

MaPE 位置编码效果:

配置DPG-BenchGenEvalVBench
标准 3D-RoPE82.10.8579.3
+ MaPE84.670.9082.5

双流 vs 单流架构:

架构理解性能生成性能参数效率
单流共享76.378.5100%
双流 MoE85.282.5120%

六、相关工作

6.1 统一多模态模型

类别代表模型特点局限性
非原生统一MetaQuery-XL, SEED-X组合预训练组件缺乏联合优化
原生统一Chameleon, Emu3联合预训练任务覆盖有限
双流统一Bagel, Show-o2解耦表征架构复杂度高

6.2 生成模型

类别代表模型特点
扩散模型SD3, FLUX连续潜在空间
Flow MatchingStable Video Diffusion速度场建模
自回归Chameleon, Emu3离散 token 预测

6.3 Lance 定位

Lance 作为轻量级原生统一模型,结合了:

  • 双流 MoE 的参数效率
  • Flow Matching 的生成质量
  • 多任务协同的涌现泛化

七、总结

7.1 核心贡献

  1. 双流 MoE 架构:理解与生成专家解耦,共享多模态上下文
  2. MaPE 位置编码:模态感知旋转编码,缓解异构 token 干扰
  3. 分阶段多任务训练:PT→CT→SFT→RL 渐进式训练策略
  4. 全面任务覆盖:支持 X2T、X2I、X2V 全任务空间
  5. 轻量高效:3B 参数实现强大性能

7.2 技术影响

影响领域具体影响
统一多模态证明轻量模型可通过多任务协同超越大模型
训练策略分阶段训练范式可推广到其他多任务场景
位置编码MaPE 为异构 token 提供有效位置区分
涌现泛化广泛任务覆盖带来未见任务泛化能力

7.3 局限性

  • 分辨率限制:当前最高支持 848p 分辨率
  • 长视频:时长受限于上下文窗口(70K tokens)
  • 3D 生成:尚未支持 3D 内容生成
  • 实时交互:推理速度有待优化

7.4 未来方向

  1. 高分辨率扩展:支持 1080p+ 分辨率
  2. 长视频生成:扩展上下文窗口支持分钟级视频
  3. 3D 统一:扩展到 3D 内容理解与生成
  4. 实时交互:优化推理速度支持实时应用

八、参考资源

8.1 论文链接

8.2 代码资源

8.3 关键图表

图表说明路径
图 1多模态基准对比figure-1-benchmark-comparison.jpg
图 2T2I 生成示例figure-2-t2i-generation.jpg
图 5X2V 生成示例figure-5-x2v-generation.jpg
图 7MaPE 位置编码figure-7-mape.jpg
图 12多模态编辑对比figure-12-multimodal-editing.jpg
图 14规模化对比figure-14-scaling-comparison.jpg

8.4 相关论文

论文作者年份关系
Qwen2.5-VLBai et al.2025视觉语言基础模型
Wan2.2Wan Team2025VAE 编码器
BagelTeam2025双流统一模型
Flow MatchingLipman et al.2023生成目标函数
GRPOShao et al.2024强化学习优化

8.5 关键技术术语

术语英文说明
流匹配Flow Matching速度场建模的生成方法
混合专家Mixture of Experts (MoE)条件路由的专家网络
模态感知位置编码MaPE区分异构 token 的位置编码
交错多模态序列Interleaved Multimodal Sequence混合文本和视觉 token 的序列
涌现泛化Emergent Generalization未见任务的零样本泛化

分析完成时间:2026年6月17日 分析工具:Claude Code + MinerU API