NVIDIA Nemotron 3: Efficient and Open Intelligence
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
44 posts tagged with "reinforcement-learning"
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
面向同步 Agentic RL 的 workload-aware rollout 系统,通过 model-free speculative decoding (SuffixDecoding) 和 cache-aware scheduling 联合优化解码与调度
First stable end-to-end JEPA that trains from raw pixels using only two loss terms (prediction + SIGReg), with ~15M params on single GPU, 48x faster planning than foundation-model world models
提出 SIA 自改进循环——由 Feedback-Agent 同时更新任务专属 agent 的「harness(脚手架)」与「模型权重(LoRA)」,打破自改进 AI 的两大孤岛(仅改 scaffold / 仅改 weights)。在中文法律分类、GPU kernel 优化、单细胞 RNA 去噪三个对比领域上,双杠杆组合全面超越单独 scaffold 迭代:LawBench +25.1%、GPU kernel 快 12.4%、去噪 +20.4%(均超先前 SOTA)
最强开源终端代理 RL 训练方案,通过 TMAX-15K 数据集和 DPPO 训练实现 Terminal-Bench 2.0 上 27% 的最优性能
面向多智能体 LLM 系统的稳定强化学习
具有空间理解和在线强化学习的视觉-语言-动作模型
面向 LLM 多智能体系统的通用 RL 优化框架
面向 Agentic RL 的灵活 Swarm 训练框架
通过解耦基础设施实现 Agentic RL 训练的规模化扩展
开源可控文本到语音系统,支持多说话人、多轮对话和自然语言指令控制
微软AI从零构建的35B/1T MoE推理模型,AIME 2025达97%,SWE-Bench Pro达52.8%
Qwen 图像生成基础模型技术报告
通过对比策略优化对齐自回归视频生成
面向快速视频生成的自洽分布匹配与缓存感知训练框架
LLM 智能体强化学习综述:从被动序列生成器到自主决策智能体
一种通过组感知上下文学习加速同步 LLM 强化学习 Rollout 的系统
模型驱动的代码预训练数据构建方法,最小化人工干预
覆盖分布式RL、RLHF系统、环境加速、采样优化、通信优化、内存优化等方向
统一FP8精度流的强化学习训练框架,实现16%端到端加速
统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成
NVIDIA Cosmos世界基础模型2.5代:面向Physical AI的视频世界仿真
面向VLA训练的灵活异步强化学习框架
腾讯混元多模态3D世界模型:统一生成与重建
Polar:在任意Agent Harness上规模化进行Agentic RL训练
高效扩展大语言模型上下文长度的训练方案
灵活高效的 RLHF 分布式训练框架
面向高效 LLM 后训练的异步流式 RL 框架
通过集体KV缓存共享扩展多智能体LLM服务
面向全模态后训练的异步强化学习引擎
端到端学习头部预算和token选择的LLM KV缓存驱逐
面向大规模 LLM 训练和推理的统一细粒度模拟器
阿里巴巴 Qwen 团队提出的统一图像生成与编辑基础模型,支持 1K token 指令输入,原生 2K 分辨率,多语言文本渲染。
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
FlashAttention 常用接口介绍,包括基本使用方法和性能优化技巧。
现有的 agentic RL 系统都采用离线批处理模式——数据收集和训练分为独立阶段,使用固定数据集。然而,每次 agent 交互都会产生一个 next-state signal(用户回复、工具输出、终端/GUI 状态变化),这些信号实时蕴含了丰富的训练信息,但没有任何现有系统将其作为在线学习...
强化学习 (RL) 已成为提升大语言模型 (LLM) 推理能力的事实范式。然而,构建一个高效、可扩展、可抢占的 RL 训练框架面临四大挑战:
通过强化学习增强视觉-语言-动作框架,实现四足机器人的显式推理和连续控制
强化学习(RL)在推进通用人工智能、具身智能和智能体智能方面展现出巨大潜力。然而,RL 工作流固有的异构性和动态性往往导致现有系统上硬件利用率低和训练缓慢。
LongCat-Video 技术报告,探索视频生成与理解的大语言模型方法。
DiLoCo 等分布式优化方法将更新分为两部分:
ReaL提出基于参数重分配的高效RLHF训练框架,通过动态调整GPU间的参数分布优化大语言模型对齐训练。
大语言模型服务动态调度系统,支持KV缓存迁移与跨实例负载均衡
序列建模的一个核心目标是设计一个单一的、有原则的模型,能够处理跨模态和任务的序列数据,特别是长程依赖(LRDs)。然而,传统模型包括 RNNs、CNNs 和 Transformers 的专门变体仍然难以扩展到 10000 步以上的超长序列。