All tags

vision-language

39 posts tagged with "vision-language"

Video Understanding: Through A Temporal Lens(面向时间维度的视频理解)

Thong Thanh Nguyen 的博士论文,从时间维度系统性地推进视频理解,围绕三大研究目标(推进边界 / 高效捕获时间 / 有效捕获时间)提出五项贡献:(1) MAMA 用减性角度间隔对比 + 元优化样本加权自动标注海量视频;(2) READ 在轻量适配器瓶颈内嵌 RNN,仅微调适配器即在低资源时间定位/视频摘要上超越全量微调;(3) GSMT 用门控状态空间模型(SSM)对密集采样帧建全局语义,配套 Ego-QA/MAD-QA 长视频问答基准;(4) MCL 用运动感知对比学习 + 强运动 tube 选择做时间全景场景图;(5) MSCL 多尺度跨尺度对比 + 特征金字塔做时间定位;并给出面向时间的 LVLM 训练配方(QueryFormer 接口 + 时间训练方案 + 记忆库 + MoE 四步扩展)。

A Survey on Vision-Language-Action Models: An Action Tokenization Perspective

从动作 tokenization 视角统一审视 VLA 模型的综述。提出 VLA 模块 + 动作 token 的统一框架,将现有 VLA 模型归为 8 种动作 token 类型(语言描述/代码/可供性/轨迹/目标状态/隐表示/原始动作/推理),逐一分析每种类型的优势、局限与未来方向,并提出分层架构趋势与从 VLA 模型到 VLA 智能体的演进路径。

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

面向真实世界部署的 VLA 全栈综述。系统梳理 VLA 三大挑战(数据稀缺 / 具身迁移 / 算力成本)、架构演进(CNN→Transformer→VLM→Diffusion/Flow→分层控制),并给出三类核心架构(sensorimotor 7 变体 / world model 3 模式 / affordance 3 模式)、模态处理(视觉/语言/动作/音频/触觉/3D)、训练范式(SL/SSL/RL + 预训练/后训练/梯度隔离/LoRA)、数据采集(遥操作/代理设备/人类视频)、公开数据集(Ego4D/OXE/DROID/AgiBot World)、机器人平台与评测基准(LIBERO/CALVIN/ManiSkill/SIMPLER/RoboArena)。最后给出面向实践者的 6 条建议与 8 个未来方向。

M*: A Modular, Extensible, Serving System for Multimodal Models

M* 提出 Walk Graph 抽象把组合式多模态模型建模为组件级 dataflow 图 + 命名 Walks;请求成为图上的遍历。四种组合原语(Sequential/Parallel/Loop/DynamicLoop)与流式边策略统一表达 UMM、Omni、SpeechLM、VLA 与世界模型。BAGEL T2I 端到端延迟低 20%,Qwen3-Omni TTS RTF 快 2.9×、吞吐高 2.7×,V-JEPA 2 机器人 rollout 提速 12.5×。

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

SharQ提出FP4量化与N:M稀疏协同的免训练推理方案:在线抽取outlier主导的稀疏骨干做sparse FP4 GEMM,再用dense FP4 GEMM对稀疏路径的量化+掩码误差做残差补偿,两路径共享单份FP4权重与path-specific scale视图。Llama-3.1-8B/Qwen2.5-7B/Qwen3-30B-A3B/Qwen3-VL-8B上恢复43–63%的NVFP4-FP16精度差,RTX 5090延迟对FP16降2.2–2.4×、对FP8吞吐提升1.2–1.4×,Wan2.2-T2V加SageAttention最高1.58×。

Qwen-Image-2.0-RL Technical Report

面向 Qwen-Image-2.0 扩散模型的 RLHF + On-Policy Distillation 后训练管线。用 VLM 微调 + 逐点评分 + CoT 构建 T2I(对齐/美学/人像)与编辑(指令遵循/人脸ID)复合奖励;基于 Flow-GRPO 引入混合 CFG(仅 rollout 用 CFG)、组内奖励范围过滤、每类权重校准、高噪声时间步采样;最后用 OPD 通过轨迹级速度匹配(W2 上界)把 T2I 与编辑双教师合并为单学生。Qwen-Image-Bench 57.84(+2.61),T2I Elo 1193(+78),编辑 Elo 1349(+93)。