NVIDIA Nemotron 3: Efficient and Open Intelligence
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
101 posts tagged with "llm-training"
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
面向 LLM 训练的 GQA-based blockwise sparse attention 机制,通过轻量 Index Branch 实现 per-GQA-group Top-k 选择,在 109B MoE 模型上实现 28.4× FLOPs 减少和 14.2× prefill / 7.6× decoding 加速
在华为昇腾 NPU SuperPOD 上对万亿参数 MoE 模型(DeepSeek-V4)进行全参数后训练的系统优化与面向运筹学的 CPT-SFT 工作流
AMD 提出的 Chopper 多粒度 GPU 剖析框架,对 8 卡 MI300X 上 Llama 3 8B 的 FSDP 训练做端到端表征,揭示频率开销(DVFS)是理论与实测性能差距的最大来源。
Meta 提出的容错混合分片数据并行 FT-HSDP:以数据并行副本为容错单元,通过 CPU-GPU 混合 FTAR 全归约与非阻塞追赶协议实现异步恢复,在 10 万 GPU 规模将有效训练时间从 44% 提升至 80%。
Tree-structured speculative rollout cache for RL that eliminates redundant computation across rollouts, enabling faster policy optimization
End-to-end TPU migration for Gemma 4 31B: 1.61× faster training at 2.12× lower cost, with 66% higher long-context inference throughput
A benchmark framework for evaluating LLMs' ability to generate fast and correct GPU kernels across 250 PyTorch workloads
块级粒度的灵活上下文并行范式,通过任意点对点通信 + bin-packing 调度,在 256 张 NVIDIA GPU 上实现近线性扩展,attention MFU 提升 1.13x–2.21x
用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速
提出 SIA 自改进循环——由 Feedback-Agent 同时更新任务专属 agent 的「harness(脚手架)」与「模型权重(LoRA)」,打破自改进 AI 的两大孤岛(仅改 scaffold / 仅改 weights)。在中文法律分类、GPU kernel 优化、单细胞 RNA 去噪三个对比领域上,双杠杆组合全面超越单独 scaffold 迭代:LawBench +25.1%、GPU kernel 快 12.4%、去噪 +20.4%(均超先前 SOTA)
基于哈密顿分解的电路交换网络架构,支持超大规模 LLM 训练的灵活、可扩展、低成本互连
分布式基础设施上大规模语言模型高效训练的全面综述,涵盖基础设施、并行策略、计算通信优化与系统可靠性
分布式 LLM 训练系统与基础设施的深度技术分析
针对万卡 GPU 集群的低开销、细粒度、常开追踪与实时分析系统,总开销 <2%,内核事件压缩 3,700x
硬件感知的TB级CTR模型训练框架,通过k步模型合并和拓扑感知通信优化实现4倍加速
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
改进极低比特 LLM 量化的缩放定律
面向多智能体 LLM 系统的稳定强化学习
通过多 token 预测训练提升 LLM 性能和推理速度
使用模型并行训练数十亿参数语言模型
神经语言模型的缩放定律:模型大小、数据集大小和计算量与损失之间的幂律关系
消除 Hopper GPU 上低精度训练和推理的填充需求
阿里巴巴Qwen团队的统一多模态模型,在文本、图像、音频、视频上无性能退化
在华为 Ascend NPU 上使用 FP16 单元模拟 FP32 GEMM 的精度恢复方法
NVIDIA B200 GPU 微基准测试与架构深度分析
面向细粒度和稀疏 MoE 的 IO 和 Tile 感知优化加速器
Qwen 图像生成基础模型技术报告
实时交互式长视频生成框架
NVFP4 量化精度提升的自适应块缩放方法
通过对比策略优化对齐自回归视频生成
通过知识蒸馏和模态自适应剪枝压缩视觉语言模型
LLM 智能体强化学习综述:从被动序列生成器到自主决策智能体
一种通过组感知上下文学习加速同步 LLM 强化学习 Rollout 的系统
通过稀疏性诱导提升 LLM 后训练剪枝精度
通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM
模型驱动的代码预训练数据构建方法,最小化人工干预
通过尾部批处理和全栈系统优化解决RL训练中长尾rollout导致的GPU利用率低问题
基于扩散的代码大语言模型,通过Block Diffusion持续预训练超越自回归基线
覆盖分布式RL、RLHF系统、环境加速、采样优化、通信优化、内存优化等方向
从硬件约束出发,推导RL训练的最优并行策略、资源分配和流水线设计
通过平滑激活离群值实现LLM的W8A8量化,支持高达530B参数模型的无损量化
基于微缩放和自动缩放的高效FP8 LLM训练方法,实现34%吞吐量提升
面向延迟最优的混合小语言模型,通过深度-宽度优化、算子搜索和权重归一化实现SOTA效率
面向GPU的3D稀疏卷积加速引擎
使用What-if分析理解大模型训练中的Straggler问题
基于树结构自适应神经老虎机路由器的在线MoE推理优化,实现45%延迟降低和25%内存节省
利用软激活稀疏性和低秩分解的LLM压缩方法
通过自辅助推测解码实现高效MoE推理,最高4.30×吞吐量提升
统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成
串行性能优化的系统方法论,包含三个原则和八种方法
A lightweight bridging paradigm that enables SOTA-level VLA performance with only 0.5B parameters, without robotic data pre-training
NVIDIA Cosmos世界基础模型2.5代:面向Physical AI的视频世界仿真
面向VLA训练的灵活异步强化学习框架
小米机器人团队发布的先进VLA模型,通过精心设计的训练方案和部署策略实现高性能实时执行
世界动作模型是否需要测试时未来想象?
MegaTrain:在单GPU上全精度训练100B+参数大语言模型
DVM:基于字节码虚拟机的动态张量计算方法
利用历史先验的生成式压缩模型实现高达10000倍地球观测数据压缩
MiniMax-M2系列:小型激活释放最大真实世界智能
Poolside Laguna M1-XS2:103B参数开放权重前沿编码Agent
高效扩展大语言模型上下文长度的训练方案
灵活高效的 RLHF 分布式训练框架
通过压缩优化器状态和激活实现高效FP8训练
HashAttention:语义稀疏性实现更快推理
DeepSeek-V3: 671B 参数 MoE 语言模型技术报告
支持100万token上下文长度的Qwen2.5模型
从 128K 到 4M:高效训练超长上下文大语言模型
面向高效 LLM 后训练的异步流式 RL 框架
通过自蒸馏提升多token预测的接受率和推理效率
面向全模态后训练的异步强化学习引擎
面向大规模 LLM 训练和推理的统一细粒度模拟器
阿里巴巴 Qwen 团队提出的统一图像生成与编辑基础模型,支持 1K token 指令输入,原生 2K 分辨率,多语言文本渲染。
Agentic RL 正在重塑 LLM 后训练,但端到端训练时间被计算密集的多轮 rollout 主导,占总时间的 70% 以上。关键挑战:
GLM-5 模型技术报告,探索从 Vibe Coding 到 Agentic Engineering 的演进。
前沿语言模型的 RL 后训练越来越多地被自回归 rollout 生成所瓶颈,使得 rollout 加速成为核心系统挑战。
现代大规模语言模型预训练严重依赖单程序多数据(SPMD)范式,需要在加速器之间进行紧密耦合。由于这种耦合,瞬时减速、硬件故障和同步开销会阻塞整个计算,在大规模训练时浪费大量计算时间。
Matrix-3D 提出从单张图像生成全方位可探索 3D 世界的统一框架。
OmniQuant 提出全方位校准的大语言模型量化方法。
GMLake 提出高效透明的 GPU 内存碎片整理方法,提升大模型训练效率。
现有的 agentic RL 系统都采用离线批处理模式——数据收集和训练分为独立阶段,使用固定数据集。然而,每次 agent 交互都会产生一个 next-state signal(用户回复、工具输出、终端/GUI 状态变化),这些信号实时蕴含了丰富的训练信息,但没有任何现有系统将其作为在线学习...
FCP:面向异构长上下文数据的自适应上下文并行策略,支持非2幂并行度、毫秒级调度开销,训练吞吐提升1.46倍
分布式 RL 后训练大语言模型面临两个通信瓶颈:
强化学习 (RL) 已成为提升大语言模型 (LLM) 推理能力的事实范式。然而,构建一个高效、可扩展、可抢占的 RL 训练框架面临四大挑战:
强化学习(RL)在推进通用人工智能、具身智能和智能体智能方面展现出巨大潜力。然而,RL 工作流固有的异构性和动态性往往导致现有系统上硬件利用率低和训练缓慢。
LongCat-Video 技术报告,探索视频生成与理解的大语言模型方法。
X-MoE是一种新型MoE训练系统,通过无填充训练管道、冗余绕过分发和序列分片MoE块等技术,在AMD GPU上实现DeepSeek风格MoE的高效可扩展训练
提出归纳矩匹配(IMM)框架,通过单阶段训练实现一步或少步生成,在ImageNet-256×256上以8步达到1.99 FID,超越扩散模型
Lumos提出高效的大规模LLM训练性能建模与估算方法,支持训练资源优化配置。
块级离散去噪扩散语言模型,在自回归和扩散之间插值,实现任意长度生成和 SOTA 似然
重新审视自回归与扩散的二分法,提出推理时扩展的两个轴:序列扩展和状态精炼
DiLoCo 等分布式优化方法将更新分为两部分:
探索VLM最小化极限,通过儿童学习启发的简单词汇数据集训练5M-25M参数的VLM,达到与1.3B模型竞争的性能
通过剪枝感知预训练实现架构无关的高效边缘语言模型,首次将LLM压缩提升到预训练阶段
A pragmatic approach to building a design system that scales with your startup without slowing you down.
通过动态输入剪枝和缓存感知掩码实现高效LLM推理,降低计算和内存开销。
面向大规模分布式模型训练的故障机器检测系统,基于LSTM-VAE无监督异常检测与机器级相似性分析,实现秒级故障响应。
ReaL提出基于参数重分配的高效RLHF训练框架,通过动态调整GPU间的参数分布优化大语言模型对齐训练。
在结构化稀疏加速器上实现非结构化稀疏加速,通过TASD方法弥合软硬件稀疏模式不匹配的鸿沟。
分布式低通信语言模型训练方法,通过内层优化器减少跨设备通信