HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
系统研究表明,经过精心筛选和标注的拟人视角(egocentric)人类视频作为具身基础模型预训练数据源,可显著超越遥操作真实机器人数据
39 posts tagged with "vision-language"
系统研究表明,经过精心筛选和标注的拟人视角(egocentric)人类视频作为具身基础模型预训练数据源,可显著超越遥操作真实机器人数据
训练高效的自压缩框架,利用预训练 VLM 自身作为内在编码器压缩视觉 token
Thong Thanh Nguyen 的博士论文,从时间维度系统性地推进视频理解,围绕三大研究目标(推进边界 / 高效捕获时间 / 有效捕获时间)提出五项贡献:(1) MAMA 用减性角度间隔对比 + 元优化样本加权自动标注海量视频;(2) READ 在轻量适配器瓶颈内嵌 RNN,仅微调适配器即在低资源时间定位/视频摘要上超越全量微调;(3) GSMT 用门控状态空间模型(SSM)对密集采样帧建全局语义,配套 Ego-QA/MAD-QA 长视频问答基准;(4) MCL 用运动感知对比学习 + 强运动 tube 选择做时间全景场景图;(5) MSCL 多尺度跨尺度对比 + 特征金字塔做时间定位;并给出面向时间的 LVLM 训练配方(QueryFormer 接口 + 时间训练方案 + 记忆库 + MoE 四步扩展)。
A comprehensive survey of world models from a robot-learning perspective, examining policy coupling, learned simulators for RL and evaluation, robotic video generation, and benchmarks/datasets across embodied applications
腾讯混元视频生成基础模型,130亿参数,涵盖数据清洗、架构设计、渐进缩放训练和高效基础设施,综合性能超越Runway Gen-3和Luma 1.6等闭源模型。
腾讯混元原生多模态模型:在自回归框架内统一多模态理解与生成,80B MoE(激活 13B),当前最大最强开源图像生成模型
腾讯轻量级开源视频生成模型,仅83亿参数即达SOTA视觉质量,支持SSTA稀疏注意力加速、视频超分到1080p、消费级GPU推理
从动作 tokenization 视角统一审视 VLA 模型的综述。提出 VLA 模块 + 动作 token 的统一框架,将现有 VLA 模型归为 8 种动作 token 类型(语言描述/代码/可供性/轨迹/目标状态/隐表示/原始动作/推理),逐一分析每种类型的优势、局限与未来方向,并提出分层架构趋势与从 VLA 模型到 VLA 智能体的演进路径。
面向真实世界部署的 VLA 全栈综述。系统梳理 VLA 三大挑战(数据稀缺 / 具身迁移 / 算力成本)、架构演进(CNN→Transformer→VLM→Diffusion/Flow→分层控制),并给出三类核心架构(sensorimotor 7 变体 / world model 3 模式 / affordance 3 模式)、模态处理(视觉/语言/动作/音频/触觉/3D)、训练范式(SL/SSL/RL + 预训练/后训练/梯度隔离/LoRA)、数据采集(遥操作/代理设备/人类视频)、公开数据集(Ego4D/OXE/DROID/AgiBot World)、机器人平台与评测基准(LIBERO/CALVIN/ManiSkill/SIMPLER/RoboArena)。最后给出面向实践者的 6 条建议与 8 个未来方向。
M* 提出 Walk Graph 抽象把组合式多模态模型建模为组件级 dataflow 图 + 命名 Walks;请求成为图上的遍历。四种组合原语(Sequential/Parallel/Loop/DynamicLoop)与流式边策略统一表达 UMM、Omni、SpeechLM、VLA 与世界模型。BAGEL T2I 端到端延迟低 20%,Qwen3-Omni TTS RTF 快 2.9×、吞吐高 2.7×,V-JEPA 2 机器人 rollout 提速 12.5×。
SharQ提出FP4量化与N:M稀疏协同的免训练推理方案:在线抽取outlier主导的稀疏骨干做sparse FP4 GEMM,再用dense FP4 GEMM对稀疏路径的量化+掩码误差做残差补偿,两路径共享单份FP4权重与path-specific scale视图。Llama-3.1-8B/Qwen2.5-7B/Qwen3-30B-A3B/Qwen3-VL-8B上恢复43–63%的NVFP4-FP16精度差,RTX 5090延迟对FP16降2.2–2.4×、对FP8吞吐提升1.2–1.4×,Wan2.2-T2V加SageAttention最高1.58×。
面向 Qwen-Image-2.0 扩散模型的 RLHF + On-Policy Distillation 后训练管线。用 VLM 微调 + 逐点评分 + CoT 构建 T2I(对齐/美学/人像)与编辑(指令遵循/人脸ID)复合奖励;基于 Flow-GRPO 引入混合 CFG(仅 rollout 用 CFG)、组内奖励范围过滤、每类权重校准、高噪声时间步采样;最后用 OPD 通过轨迹级速度匹配(W2 上界)把 T2I 与编辑双教师合并为单学生。Qwen-Image-Bench 57.84(+2.61),T2I Elo 1193(+78),编辑 Elo 1349(+93)。
统一多模态理解与生成模型综述:系统梳理三大架构范式(扩散/自回归/混合),数据集与基准测试
开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解
基于 PCA 旋转的 DiT 4-bit 后训练量化框架
基于 MLLM 语义规划和 DiT 渲染的统一视频生成与编辑框架
开源可控文本到语音系统,支持多说话人、多轮对话和自然语言指令控制
A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
8B参数高效多模态大语言模型,通过统一3D-Resampler、文档知识统一学习范式和混合强化学习实现性能与效率的平衡
通过知识蒸馏实现高效视频帧选择的查询无关方法,在低帧预算下显著优于现有方法
通过重要性基�的固定容量循环状态实现视频VLM的线性时间预填充,在长视频理解中接近全自注意力性能
NVIDIA全模态世界模型,统一语言、图像、视频、音频和动作的理解与生成,为Physical AI提供通用骨干网络
通用分布式加速框架,通过异步去噪实现扩散模型的多设备并行推理
解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析
面向多模态大模型的EPD阶段解耦推理系统,在昇腾NPU上实现57-69%吞吐量提升
腾讯混元多模态3D世界模型:统一生成与重建
轻量级原生统一多模态模型,通过双流MoE架构和多任务协同训练实现图像视频理解、生成与编辑
现有的 agentic RL 系统都采用离线批处理模式——数据收集和训练分为独立阶段,使用固定数据集。然而,每次 agent 交互都会产生一个 next-state signal(用户回复、工具输出、终端/GUI 状态变化),这些信号实时蕴含了丰富的训练信息,但没有任何现有系统将其作为在线学习...
支持时空定位、时序检索和视频问答的大规模多模态模型,通过统一编码架构实现视频理解与创作
首个多视频理解评估基准,评估MLLM在跨视频感知和推理方面的8项核心能力
通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理
首个十亿级短剧剧本-拍摄脚本对数据集,重新定义拍摄脚本格式以支持 AI 短剧生成,涵盖高光检测、世界布局理解和隐式角色关系挖掘
首个17B参数的交互式世界基础模型,通过两阶段训练(无标签预训练+动作标注训练)实现Minecraft可控制视频生成,支持键盘/鼠标动作控制
首个多语言多条件语义检索数据集,通过对比重建框架提升检索性能45.9%
探索VLM最小化极限,通过儿童学习启发的简单词汇数据集训练5M-25M参数的VLM,达到与1.3B模型竞争的性能
A pragmatic approach to building a design system that scales with your startup without slowing you down.
通过长和丰富上下文(LRC)建模,增强视频多模态大语言模型的细粒度细节感知和长时序结构捕获能力
Apple提出的高效视觉语言模型,通过新型混合视觉编码器FastViTHD实现85×更快的首token延迟,同时保持竞争性准确率
通过三阶段渐进训练和6B参数视频编码器,在70+视频理解任务上实现SOTA性能的视频基础模型