Back to blog

V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

Next-gen JEPA model with dense predictive loss, deep self-supervision, and multi-modal tokenizers achieving SOTA on dense visual tasks (depth, segmentation, STA) while retaining global scene understanding

V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

一、论文概述

项目内容
标题V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
作者Lorenzo Mur-Labadia*, Matthew Muckley*, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, Adrien Bardes*†
机构FAIR at Meta / Universidad de Zaragoza
论文https://arxiv.org/abs/2603.14482
代码https://github.com/facebookresearch/vjepa2
发布arXiv:2603.14482v1 [cs.CV], Mar 15, 2026
许可未明确

二、核心思想

问题定义

V-JEPA 2 (Assran et al., 2025) 在全局场景理解(运动识别、动作预判)方面表现优异,但其学到的表示缺乏密集空间结构:

  1. 稀疏特征图:V-JEPA 2 的特征图存在噪声,难以用于需要像素级/patch 级定位的任务(深度估计、语义分割、物体跟踪)
  2. 全局-密集权衡:现有方法难以同时保持全局场景理解能力和密集空间结构
  3. 机器人操控局限:V-JEPA 2 AC 在真实机器人抓取任务中成功率较低

解决方案概述

本文提出 V-JEPA 2.1——一个能够学习密集高质量视觉表示的 JEPA 模型家族,同时保留强大的全局场景理解能力。核心四大创新:

  1. Dense Predictive Loss(密集预测损失):让所有 tokens(可见上下文 + masked tokens)都贡献训练信号,鼓励显式空间和时间定位
  2. Deep Self-Supervision(深度自监督):在多个中间编码器层上分层应用自监督目标,提升表示质量
  3. Multi-Modal Tokenizers(多模态 tokenizer):支持图像和视频的统一训练
  4. 有效扩展:模型容量和训练数据的双重扩展

V-JEPA 2.1 Teaser

与 V-JEPA 2 的关键区别

特性V-JEPA 2V-JEPA 2.1
预测损失仅 masked tokens所有 tokens(masked + context)
监督层级仅顶层多层(deep self-supervision)
Tokenizer独立图像/视频统一多模态
密集特征质量有限(噪声大)SOTA(空间一致)
全局理解强保持并增强

三、技术架构

整体架构

Architecture

Input: Image or Video
    ↓
2D Conv Tokenizer (image) 或 3D Conv Tokenizer (video)
    ↓
+ 3D Rotational Positional Encoding (RoPE)
+ Learnable Modality Embedding
    ↓
┌─────────────────────────────────────┐
│              x-encoder               │
│  (processes visible tokens)          │
│                                      │
│  Multi-level embeddings from         │
│  intermediate encoder blocks         │
│  → concatenated → MLP fusion         │
│  → reduced dimensionality            │
│  = Context Tokens                    │
└─────────────────────────────────────┘
    ↓
Context Tokens + Learnable Mask Tokens (spatio-temporal pos)
    ↓
┌─────────────────────────────────────┐
│             Predictor                │
│  (multi-level predictions for        │
│   masked tokens)                     │
└─────────────────────────────────────┘
    ↓
┌─────────────────────────────────────┐
│              y-encoder               │
│  (target encoder, EMA weights)       │
│                                      │
│  Multi-level embeddings              │
│  = Target Representations            │
└─────────────────────────────────────┘
    ↓
Two Losses:
  ① L1 Loss on masked-token predictions (original V-JEPA objective)
  ② Distance-weighted L1 Loss on nearby context tokens (new context loss)

核心公式

原始 V-JEPA 损失(Masked Token Prediction)

Lmask=∥z^m−zmy∥1\mathcal{L}_{mask} = \| \hat{\mathbf{z}}_m - \mathbf{z}_m^{y} \|_1

其中 z^m\hat{\mathbf{z}}_m 是 predictor 对 masked tokens 的预测,zmy\mathbf{z}_m^y 是 y-encoder(EMA target)的输出。

Dense Predictive Loss(新增 Context Loss)

Lctx=∑i,j∈contextwij∥z^i−zjy∥1\mathcal{L}_{ctx} = \sum_{i,j \in \text{context}} w_{ij} \| \hat{\mathbf{z}}_i - \mathbf{z}_j^y \|_1

其中 wijw_{ij} 是基于空间/时间距离的权重——邻近 tokens 获得更高权重。

关键洞察:传统 JEPA 只监督 masked tokens 的预测,而 context tokens 不参与损失计算。V-JEPA 2.1 通过 Lctx\mathcal{L}_{ctx} 显式监督所有可见上下文的预测,使模型学到具有显式空间结构的表示。

Context Loss Effect

对比可视化:

  • V-JEPA 2:仅显示碎片化的局部空间结构
  • V-JEPA 2 + Lctx\mathcal{L}_{ctx}:特征图呈现连贯的空间结构,相似语义部分(如狗头、车轮)映射到相同 PCA 分量

Deep Self-Supervision

在多个中间编码器层上分层应用自监督目标:

Ldeep=∑l∈layersλl⋅Lpred(l)\mathcal{L}_{deep} = \sum_{l \in \text{layers}} \lambda_l \cdot \mathcal{L}_{pred}^{(l)}

其中 Lpred(l)\mathcal{L}_{pred}^{(l)} 是在第 ll 层输出的嵌入上计算的预测损失。

x-encoder 的输出包含来自中间编码器块的多层嵌入拼接,经过 MLP 融合后降维。

总损失

Ltotal=Lmask+α⋅Lctx+β⋅Ldeep\mathcal{L}_{total} = \mathcal{L}_{mask} + \alpha \cdot \mathcal{L}_{ctx} + \beta \cdot \mathcal{L}_{deep}

Multi-Modal Tokenizers

  • 2D Conv Tokenizer(图像):标准卷积 patch embedding
  • 3D Conv Tokenizer(视频):时空卷积 patch embedding
  • 统一处理图像和视频,共享大部分架构参数

训练流程

Ablation 路径(Fig. 5)

从 ViT-L 基线开始逐步添加组件:

  1. Weighted-Context SSL(Lctx\mathcal{L}_{ctx}):显著提升分割性能,分类略有下降
  2. Deep Self-Supervision:恢复分类性能,进一步提升分割
  3. VisionMix 163M 数据集 + Multi-Modal Tokenizer:进一步改善结果
  4. 模型规模扩展 + 高分辨率 cooldown:最终提升

预训练细节

数据:

  • VisionMix 163M 数据集(大规模图像/视频混合)
  • 100 万+ 小时视频(延续 V-JEPA 2 的数据规模)

模型规模:

  • ViT-L / ViT-G / ViT-G+
  • 最高参数规模超过 1B

训练策略:

  • 渐进式分辨率训练(延续 V-JEPA 2)
  • Cooldown 阶段使用更高分辨率和更长视频片段
  • EMA target encoder(延续 V-JEPA 2)

四、核心创新

创新点说明理论/实验依据
Dense Predictive Loss所有 tokens(可见+masked)都参与损失计算Fig. 3: PCA 可视化显示连贯空间结构
Context Loss Lctx\mathcal{L}_{ctx}基于距离加权的 L1 损失监督邻近 context tokens分割任务显著改善,代价是分类略降
Deep Self-Supervision多层编码器输出均受自监督目标约束恢复分类性能,进一步提升分割
Multi-Modal Tokenizers2D/3D 卷积 tokenizer 统一训练图像和视频消除图像/视频分别训练的开销
VisionMix 163M 数据扩展更大规模的混合图像/视频数据持续提升各任务性能
全局-密集统一首次在同一模型中实现 SOTA 密集特征 + 全局理解15 项基准测试中多项 SOTA

五、实验结果

整体性能对比(Fig. 2)

V-JEPA 2.1 ViT-G 相比 V-JEPA 2 ViT-g 的全面改进:

任务类别具体任务改进幅度
密集预测Depth Estimation (NYUv2)SOTA
密集预测Semantic Segmentation (VOC12/Cityscapes)SOTA
密集预测Object TrackingSOTA
全局理解SSv2 Action Recognition77.7% (SOTA)
全局理解Kinetics-400SOTA
全局理解Image ClassificationSOTA
动作预判EPIC-KITCHENS Recall@540.8 (SOTA)
短期待判Ego4D STA mAP7.71 (SOTA)
机器人Real-Robot Grasping+20% vs V-JEPA 2 AC
机器人TartanDrive Navigation ATE5.687 (SOTA)

密集特征质量

Dense Features Comparison

对比不同 SSL 方法的密集特征:

  • DINOv2 ViT-g
  • DINOv3 ViT-H+
  • V-JEPA 2 ViT-g
  • V-JEPA 2.1 ViT-G ← 本文

V-JEPA 2.1 在 Cityscapes 图像上展现出最清晰、最一致的密集特征。

视频密集特征

Video Dense Features

在 Ego4D、Cityscapes、Diving48、MOCA 等数据集上展示:

  • 动态物体的时间一致性显著改善
  • 整个视频序列处理时保持一致的语义编码

深度估计

Depth Comparison

  • V-JEPA 2:捕获整体场景几何但缺乏局部一致性和精确边界结构
  • V-JEPA 2.1:产生更锐利、更连贯、更细粒度的深度图
  • NYUv2 RMSE: 0.307(线性探测)

vs DINOv3

  • V-JEPA 2.1 ViT-G 在细粒度细节(如交通灯轮廓)和尺度一致性上优于 DINOv3 ViT-H++
  • DINOv3 在某些场景中错误判断绿色物体和电视的深度

语义分割

Segmentation VOC12

  • V-JEPA 2 因特征图噪声产生稀疏语义掩码
  • V-JEPA 2.1 达到与 DINOv3 ViT-H+ 竞争的性能

视频目标分割(VOS)

VOS DAVIS

给定初始帧的 ground-truth 对象掩码,基于 V-JEPA 2.1 嵌入空间中的 patch 相似度传播实例掩码到后续帧。

短期待判(Short-Term Anticipation, STA)

STA Diagram

Ego4D 基准:7.71 mAP(SOTA)

给定观察到时刻 tt 的视频 V:tV_{:t},模型预测未来对象-交互事件集合:

  1. 边界框(定位将被交互的对象)
  2. 名词类别(对象类型)
  3. 动词类别(即将发生的交互)
  4. 期待时间 δ\delta(当前帧到交互开始之间的秒数)

Ground-truth 标签从接触帧 Vt+δV_{t+\delta} 导出,但在最后观测帧 VtV_t 的坐标系中表示。

STA Qualitative

V-JEPA 2.1 预测多个场景,预测的对象和动词类别对应合理的人-物交互。

动作预判(Action Anticipation)

EPIC-KITCHENS-100:40.8 Recall@5(超越 prior 任务特定模型)

机器人任务

真实机器人抓取

Robot Grasp

在 Franka Panda 机械臂上的零样本评估:

  • V-JEPA 2.1 特征更好地编码深度信息
  • 在涉及沿相机深度轴推理的抓取任务中,抓取成功率提升 20%
  • 使用 MPC 和视觉目标规格

导航规划

Navigation Planning

  • V-JEPA 2.1 实现 10x 更快且更准确的导航规划
  • 比 (Bar et al., 2025) 的基线快 10 倍
  • TartanDrive:5.687 ATE(SOTA)
  • 在潜在空间中展示 start→goal 的 10×10 规划轨迹

六、消融实验

各组件影响(Fig. 5)

从 ViT-L 基线开始逐步添加:

步骤添加组件ADE20k 分割SSv2 分类
1Baseline--
2+ Weighted-Context SSL (Lctx\mathcal{L}_{ctx})↑↑↓
3+ Deep Self-Supervision↑↑↑↑ (恢复并超越)
4+ VisionMix 163M + Multi-Modal Tokenizer↑↑
5+ Model Scaling + High Res Cooldown↑↑↑↑

关键发现:

  • Lctx\mathcal{L}_{ctx} 单独提升分割但损害分类
  • Deep Self-Supervision 恢复分类性能并进一步提升分割
  • 两者结合产生最佳效果

与 DINOv3 对比

V-JEPA 2.1 ViT-G 在多项密集任务上达到或超越 DINOv3 ViT-H++(参数量更大):

  • 深度估计:更锐利、更一致的深度图
  • 语义分割:更精细的边界结构
  • 物体跟踪:更好的尺度一致性

七、相关工作

工作关系
V-JEPA 2 (Assran et al., 2025)前身,仅 masked token 预测,密集特征质量有限
V-JEPA (Bardes et al., 2024)原始版本,使用 stop-gradient + EMA
I-JEPA图像版本 JEPA
DINO/DINOv2/DINOv3 (Caron et al.)对比学习 SSL,密集特征质量好但全局理解弱于 JEPA
MAE (He et al.)掩码自编码器,重建像素级信号
PLDM端到端 JEPA,使用 VICReg
DINO-WM冻结 DINOv2 编码器用于世界模型
STAformer短期待判 SOTA,但非自监督方法

八、总结

核心贡献

  1. Dense Predictive Loss:首个在 JEPA 框架下让所有 tokens(visible + masked)参与训练损失的方法
  2. Context Loss Lctx\mathcal{L}_{ctx}:基于距离加权的 L1 损失,显式监督邻近 context tokens 的预测
  3. Deep Self-Supervision:多层编码器输出分层应用自监督目标
  4. Multi-Modal Tokenizers:统一图像和视频训练的 2D/3D 卷积 tokenizer
  5. SOTA 密集特征:深度估计、语义分割、物体跟踪等多项密集任务 SOTA
  6. SOTA 全局理解:SSv2 77.7%、EK100 40.8 Recall@5、Ego4D STA 7.71 mAP
  7. 机器人提升:真实机器人抓取成功率提升 20%,导航规划快 10x

技术影响

  • 打破了 JEPA 全局-密集的权衡:首次在同一模型中实现 SOTA 密集特征和全局理解
  • 为视觉世界模型提供了更高质量的表示:密集特征对于深度估计、分割、跟踪等下游任务至关重要
  • 证明了 context supervision 的价值:不仅 masked tokens,可见 tokens 也受益于自监督目标

局限性

  1. Context loss 对分类的负面影响:单独使用 Lctx\mathcal{L}_{ctx} 会降低分类性能,需配合 deep self-supervision
  2. 计算开销增加:多层监督和 context loss 增加了训练成本
  3. 3D tokenizer 容量需求:视频 tokenizer 需要更多内存和计算
  4. 深度估计精度仍有限:虽然比 V-JEPA 2 大幅改善,但与专门方法仍有差距
  5. 机器人部署范围有限:仅在 table-top Franka Panda 上验证

九、参考资源