Back to blog

Kwai Keye-VL-2.0 Technical Report

开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解

Kwai Keye-VL-2.0 Technical Report: 开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解

一、论文概述

项目内容
标题Kwai Keye-VL-2.0 Technical Report
作者Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, et al.
机构快手 (Kuaishou)
论文arXiv:2606.10651
代码未开源
发布2026年6月9日
许可CC BY 4.0

二、核心思想

Kwai Keye-VL-2.0-30B-A3B 是快手推出的开源多模态基础模型,采用30B参数的混合专家(MoE)架构,但仅激活3B参数。该模型旨在解决超长视频理解中的两个核心挑战:

  1. 基础设施瓶颈:扩展到极端视频上下文会导致计算和内存成本激增
  2. 算法困境:集成复杂异构智能体任务会导致灾难性遗忘,降低基础推理能力

问题定义

现有模型在处理小时级视频时面临两大难题:

  • 标准密集注意力机制导致KV缓存灾难性膨胀,迫使模型通过激进的帧子采样牺牲时间连续性
  • 多任务对齐过程中,直接注入视频理解和工具使用能力会触发灾难性遗忘,降低STEM、数学和语言推理能力

解决方案概述

Keye-VL-2.0通过以下创新解决上述问题:

  1. 多模态DSA(DeepSeek Sparse Attention):首次将DSA应用于GQA多模态架构,实现无损256K上下文处理
  2. 跨模态多教师在线蒸馏(MOPD):通过Context-RL和Video-RL解决多任务对齐中的灾难性遗忘
  3. 高效训练和推理基础设施:包括可扩展视频I/O、异构ViT-LM并行和自定义DSA内核

三、技术架构

整体框架图

预训练流水线

模型由四个核心组件构成:

组件说明关键参数
Vision Encoder (ViT)继承自Keye-VL-1.5-8B,提取视觉特征SigLIP-400M-384-14
Language Decoder (LLM)基于Qwen3-30B-A3B-Thinking-250730B参数,3B激活
MLP Projector随机初始化,Stage 0训练对齐视觉-语言特征
Sparse Attention ModuleGQA兼容的DSA设计全局MQA索引 + 分组GQA聚合

核心公式

DSA Lightning Indexer评分函数: It,s=∑j=1HIwt,jI⋅ReLU(qt,jI⋅ksI)I_{t,s} = \sum_{j=1}^{H^I} w_{t,j}^I \cdot \text{ReLU}(q_{t,j}^I \cdot k_s^I)

其中 HIH^I 是索引器头数,qt,jIq_{t,j}^I 和 wt,jIw_{t,j}^I 来自当前查询token hth_t,ksIk_s^I 是共享键。

Top-k稀疏索引集: Ωt={s∣It,s∈Top-k(It,:)}\Omega_t = \{s \mid I_{t,s} \in \text{Top-k}(I_{t,:})\}

GQA稀疏聚合: ut,g=Attn(ht,g,{cs,g∣s∈Ωt})u_{t,g} = \text{Attn}(h_{t,g}, \{c_{s,g} \mid s \in \Omega_t\})

设置 k=2048k=2048,将核心注意力复杂度从 O(L2)O(L^2) 降低到 O(Lk)O(Lk),其中 k≪Lk \ll L。

密集预热损失: LwarmupI=∑t∑g=1GDKL(pt,:,g∥Softmax(It,:))\mathcal{L}_{\text{warmup}}^I = \sum_t \sum_{g=1}^G \mathbb{D}_{KL}(p_{t,:,g} \parallel \text{Softmax}(I_{t,:}))

稀疏适应损失: LsparseI=∑t∑g=1GDKL(pt,St,g∥Softmax(It,St))\mathcal{L}_{\text{sparse}}^I = \sum_t \sum_{g=1}^G \mathbb{D}_{KL}(p_{t,S_t,g} \parallel \text{Softmax}(I_{t,S_t}))

模型组件

Native-Resolution Vision Encoder:

  • 自适应位置编码:插值固定绝对可学习位置嵌入,支持可变分辨率
  • 2D RoPE:引入二维旋转位置嵌入,提升空间建模能力
  • 序列打包:结合NaViT的Patch n’ Pack机制和FlashAttention,支持变分辨率批量训练

DSA for Long-Context Multimodal Modeling:

  • MQA风格闪电索引器:全局MQA键共享设计,FP8实现
  • GQA稀疏聚合:相同稀疏索引集应用于所有组,保持GQA骨干表示结构
  • 两阶段训练:密集预热(2B多模态token)+ 稀疏适应

训练流程

场景级密集描述

预训练四阶段课程:

阶段上下文长度训练token数训练内容
Stage 0--仅训练Projector,初始化视觉-语言映射
Stage 132K~1T全参数多模态预训练,建立视觉-语言对齐
Stage 264K~2T多任务能力注入(OCR, VQA, STEM, GUI, grounding等)
Stage 3256K-长上下文扩展,聚焦长视频、多页文档、长程智能体轨迹

视频预训练策略:

  • 每个视频分割为15秒片段
  • 每个片段配对caption,组织为交错多模态序列
  • 支持时间连续性、场景转换和事件演进理解

后训练流程:

  • SFT(监督微调):~500B token,包含Text NLP, Video, Perception, Reasoning, Agent, Long-context数据
  • 合成CoT:强教师模型生成推理链,通过质量检查过滤
  • 强化学习:Context-RL, Video-RL, 域特定RL(Math, Grounding, OCR等)

四、核心创新

推理成本对比

创新点说明理论/实验依据
多模态DSA首次将DeepSeek Sparse Attention应用于GQA多模态架构无损256K上下文处理,推理成本显著降低
Native-Resolution ViT原生分辨率视觉编码,避免裁剪或平铺保持全局结构和局部细节,特别适合文档、OCR、视频场景
MOPD跨模态蒸馏跨模态多教师在线蒸馏,解决多任务对齐中的灾难性遗忘密集token级教师反馈蒸馏回MoE骨干
ViT-LM异构并行ViT和LM采用不同并行分片策略,负载均衡训练吞吐量提升约20%
DSA内核优化使用FlashInfer和TileLang优化DSA,实现2倍以上加速Top-k内存优化、短序列优化、索引器损失优化

五、代码实现分析

论文未开源代码,但从技术报告可推断关键实现细节:

训练基础设施:

  • ExtraIO:异步流水线的可扩展I/O服务,解耦视频解码和帧采样
  • ViT-LM异构并行:ViT和LM位于同一GPU组,但采用独立并行分片策略
  • 两级负载均衡:多模态token级别和LM样本级别均衡

推理优化:

  • Chunk ViT推理:将视觉编码分块处理,支持超长视频
  • DSA+GQA联合推理:全局MQA索引 + 分组GQA聚合
  • FP8量化:闪电索引器使用FP8实现,提升效率

六、实验结果

评估总结

基准测试

视频理解:

基准Keye-VL-2.0Qwen3.5-35B-A3BInternVL3.5-241BGPT-5-miniQwen3-VL-235B
LongVideoBench74.161.667.1-70.5
Video-MME-v2 (64帧)35.332.6--33.3
Video-MME-v2 (512帧)42.428.5--36.8
MLVU82.885.678.283.383.8
Video-MME (w/o sub.)78.382.572.978.979.0

时间定位(TimeLens):

基准Keye-VL-2.0Qwen3.5-35B-A3BQwen3-VL-235B
ActivityNet-TimeLens58.553.252.1
QVHighlights-TimeLens---
Charades-TimeLens---

代码智能体:

基准Keye-VL-2.0Qwen3.5-35B-A3BGPT-5-miniQwen3-VL-235B
SWE-bench Verified----
WebArena----

消融实验

论文未提供详细消融实验,但从训练流程可推断:

  1. DSA两阶段训练:密集预热(2B token)→ 稀疏适应,确保索引器覆盖所有GQA组的注意力分布
  2. MOPD多教师蒸馏:域特定教师(Math, Grounding, OCR, LAN-Instruct)路由,权重共享复用服务器实例
  3. Context-RL:上下文强化学习,提升长程推理能力
  4. Video-RL:视频强化学习,增强时序理解

与现有方法对比

Keye-VL-2.0-30B-A3B在以下方面表现突出:

  • 长视频理解:LongVideoBench 74.1(超越Qwen3-VL-235B的70.5)
  • 时间定位:ActivityNet-TimeLens 58.5(超越Qwen3.5-35B-A3B的53.2)
  • 模型效率:30B参数仅激活3B,推理成本显著低于同等规模密集模型
  • 上下文长度:支持256K无损处理,适合小时级视频

七、相关工作

  1. DeepSeek Sparse Attention (DSA):DeepSeek-V3.2引入的稀疏注意力机制,Keye-VL-2.0首次将其应用于GQA多模态架构
  2. Native-Resolution ViT:NaViT, Qwen3.5, K2.5, MiMO等模型采用的原生分辨率视觉编码
  3. Mixture-of-Experts (MoE):Shazeer等人提出的混合专家架构,Keye-VL-2.0采用30B参数仅激活3B的设计
  4. 多模态强化学习:Context-RL, Video-RL等方法,用于提升长程推理和时序理解能力
  5. 跨模态蒸馏:MIMO v2 Flash等模型采用的多教师在线蒸馏方法

八、总结

核心贡献

  1. 多模态DSA架构:首次将DeepSeek Sparse Attention应用于GQA多模态架构,实现无损256K上下文处理
  2. Native-Resolution ViT:原生分辨率视觉编码,保持全局结构和局部细节
  3. MOPD跨模态蒸馏:解决多任务对齐中的灾难性遗忘,通过密集token级教师反馈蒸馏
  4. 高效训练推理基础设施:ViT-LM异构并行、DSA内核优化、Chunk ViT推理
  5. SOTA性能:在长视频理解、时间定位等基准上达到同等规模模型领先水平

技术影响

  • 长视频理解:使小时级视频理解成为可能,突破传统模型的帧数限制
  • 部署效率:30B参数仅激活3B,推理成本可控,适合实际应用
  • 开源生态:提供开源模型检查点,推动社区向可扩展多模态智能体应用发展
  • 基础设施:异构并行和DSA优化为大规模多模态训练提供参考

局限性

  1. 代码未开源:技术报告未提供代码实现细节
  2. 评估覆盖有限:部分基准(如WebArena、SWE-bench)结果未提供
  3. 训练成本:四阶段预训练和多阶段后训练需要大量计算资源
  4. 智能体能力:虽然支持Code、Tool、Search场景,但具体实现细节不足

九、参考资源

  • 论文: arXiv:2606.10651
  • HTML版本: arXiv HTML
  • 相关工作:
    • DeepSeek-V3.2: DeepSeek Sparse Attention (DSA)
    • Qwen3-30B-A3B: 语言解码器基础
    • Keye-VL-1.5: 视觉编码器继承
    • SigLIP-400M-384-14: ViT骨干网络