VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
训练高效的自压缩框架,利用预训练 VLM 自身作为内在编码器压缩视觉 token
28 posts tagged with "vlm"
训练高效的自压缩框架,利用预训练 VLM 自身作为内在编码器压缩视觉 token
开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解
具有空间理解和在线强化学习的视觉-语言-动作模型
基于 PCA 旋转的 DiT 4-bit 后训练量化框架
通过知识蒸馏和模态自适应剪枝压缩视觉语言模型
一种无需训练的结构化推理加速框架,用于加速扩散式视觉-语言-动作模型
A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM
高保真仿真就绪3D内容生成系统,支持场景布局、部件分解和铰接生成
通过知识蒸馏实现高效视频帧选择的查询无关方法,在低帧预算下显著优于现有方法
通过重要性基�的固定容量循环状态实现视频VLM的线性时间预填充,在长视频理解中接近全自注意力性能
NVIDIA全模态世界模型,统一语言、图像、视频、音频和动作的理解与生成,为Physical AI提供通用骨干网络
基于分块软匹配的在线KV缓存聚类框架,实现80%内存节省和3.19倍解码加速
解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析
统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成
NVIDIA Cosmos世界基础模型2.5代:面向Physical AI的视频世界仿真
小米机器人团队发布的先进VLA模型,通过精心设计的训练方案和部署策略实现高性能实时执行
面向设备端LLM的动态分层稀疏注意力长上下文建模
通过压缩优化器状态和激活实现高效FP8训练
面向全模态后训练的异步强化学习引擎
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
通过解耦视觉稀疏性,在预填充和解码阶段分别进行查询无关剪枝和查询感知检索,实现高效VLM推理
通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成
提出归纳矩匹配(IMM)框架,通过单阶段训练实现一步或少步生成,在ImageNet-256×256上以8步达到1.99 FID,超越扩散模型
针对资源受限环境的低延迟视觉语言模型推理流水线
探索VLM最小化极限,通过儿童学习启发的简单词汇数据集训练5M-25M参数的VLM,达到与1.3B模型竞争的性能
Apple提出的高效视觉语言模型,通过新型混合视觉编码器FastViTHD实现85×更快的首token延迟,同时保持竞争性准确率