NVIDIA Nemotron 3: Efficient and Open Intelligence
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
6 posts tagged with "inference-optimization"
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
DSpark 结合半自回归生成和置信度调度验证,统一高吞吐并行生成与自适应负载感知验证,在 DeepSeek-V4 生产系统中实现 60%-85% 生成加速
Transformer 推理全栈优化综述,涵盖硬件设计、软件优化、调度策略和神经架构搜索
无需训练的视频扩散模型加速策略,通过动态特征复用和 CFG-Cache 实现 1.67x 加速同时保持高质量生成
通过复用闲置尾部模型服务作为远程草稿模型,实现资源高效的 LLM 推理服务
通过阶段式协调推理架构,实现流式 VideoLLM 在单 A100 GPU 上达到 134 FPS 吞吐量和低于 50ms TTFT