Next Forcing: Causal World Modeling with Multi-Chunk Prediction
多块预测(MCP)训练框架,通过轻量辅助模块同时去噪多个未来视频块,加速世界动作模型训练与推理
18 posts tagged with "vla"
多块预测(MCP)训练框架,通过轻量辅助模块同时去噪多个未来视频块,加速世界动作模型训练与推理
End-to-End VLA with Differentiable Latent Intent Bottleneck
具有空间理解和在线强化学习的视觉-语言-动作模型
首个免训练、即插即用的VLA推理加速框架,通过动作复用和视觉token剪枝实现55.7% FLOPs降低和36.0%延迟降低
一种无需训练的结构化推理加速框架,用于加速扩散式视觉-语言-动作模型
A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
NVIDIA全模态世界模型,统一语言、图像、视频、音频和动作的理解与生成,为Physical AI提供通用骨干网络
全方向校准的LLM量化技术,通过LWC和LET实现PTQ效率与QAT性能的统一
统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成
NVIDIA Cosmos世界基础模型2.5代:面向Physical AI的视频世界仿真
面向VLA训练的灵活异步强化学习框架
小米机器人团队发布的先进VLA模型,通过精心设计的训练方案和部署策略实现高性能实时执行
KV-Cache-centric memory management system for efficient embodied planning with static-dynamic memory construction, multi-hop recomputation, and layer-balanced loading
世界动作模型是否需要测试时未来想象?
面向KV缓存的免调优非对称量化
通过压缩优化器状态和激活实现高效FP8训练
通过强化学习增强视觉-语言-动作框架,实现四足机器人的显式推理和连续控制
强化学习(RL)在推进通用人工智能、具身智能和智能体智能方面展现出巨大潜力。然而,RL 工作流固有的异构性和动态性往往导致现有系统上硬件利用率低和训练缓慢。