The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系
Thoughts on design, development, and building products.
最大规模的训练无关稀疏注意力经验分析,覆盖Qwen 2.5/Llama 3.1/Gemma 3三大模型家族(4B-72B)、16K-128K序列长度、稀疏度0-0.95,发现稀疏注意力Pareto前沿、prefill/decode两阶段行为差异、序列长度与稀疏容忍度关系
训练自由、无采样的动态稀疏注意力框架,通过线性近似模型预测三种核心注意力模式(块对角、平行对角、垂直)的强度演化,在 HunyuanVideo 上实现 2.05× 加速,在 Wan2.1 上实现 1.75× 加速。
基于信息瓶颈原理统一解释KV缓存驱逐方法,提出CapKV——通过统计杠杆分数最大化对数行列式容量目标,显著提升长上下文推理的性能-内存权衡
边缘/MoE 推理实证:OLMoE-1B-7B 在 Jetson Orin Nano 上比同 active 参数量 Dense 模型慢 31%,能耗高 2.1 倍;边缘带宽受限硬件上推理成本跟随总参数而非激活参数
ScalingAttention:通过权重编码的内在稀疏注意力拓扑发现机制(WEST)与保真度感知的稀疏度自适应调节(FAST)以及位级块稀疏注意力内核(crm kernel),实现视频扩散Transformer的高效训练无关推理加速
Kaleido 通过挖掘视频潜在空间通道级时空相关性,提出通道级复用算法与可重构 PE 阵列加速器,最高 6.6× 加速、18.4× 能耗节省,PSNR 提升 >17 dB
An unsupervised on-policy self-distillation method that replaces ground-truth solutions with majority-vote consensus, outperforming supervised OPSD by 3.2%/2.3% on Qwen3-4B/8B non-thinking mode.
A memory-centric LLM inference system that decouples full KV-cache storage from HBM, using lookahead tokens from speculative decoding to prefetch only the most relevant KV blocks, achieving 1.69×-2.3× throughput gains within 0.7 points of full-attention accuracy.
A self-developing agent harness whose tools, context assembly, prompts and core implementation improve through reviewed commits that become the runtime for later work. Achieves SOTA on Terminal-Bench 2.1 (86.74%), OSWorld-Verified (90.69%), and CL-Bench (0.2301).
TopKV — 拓扑感知的KV缓存传输编排器,利用GPU互连层次结构将KV缓存传输延迟降低3-18倍
首个将张量生命周期管理从计算栈中解耦的分布式服务层,通过 Artifact/Operation/Plan/Signal 四抽象实现 TaaS 范式,集成 vLLM/SGLang 后权重物化加速 60×、KV 缓存共享 TTFT 降低 87.5%
训练无关动态稀疏注意力:通过查询依赖高斯校准阈值、在线 Softmax 内联稀疏化和零阶泰勒代理分数复用,在不修改权重的情况下为视频生成 DiT 提供 2.0×–5.1× 端到端加速
内核-运行时协同设计:通过闭式树验证、值域分块GPU核和因子化推测状态,将混合注意力LLM的树投机解码吞吐量提升至自回归解码的4.72×
免训练的两阶段渐进式 token 压缩框架:LLM 前的模态特异结构压缩 + LLM 内的查询条件音视协同精炼
基于语义 RGBA 图层的原生视觉设计框架:T2RGBA 文本生成 RGBA 资产 + I2L 指令驱动的图像分层解构
16B 参数自回归扩散模型,通过分块因果适配、源锚定蒸馏和长时序自回归蒸馏,实现单张 B200 GPU 上720p@30FPS 的实时流式视频编辑
SmartGen 解决自托管 LLM 推理中 P/D 分离架构的网络瓶颈问题,通过三种 KV 缓存传输路径(Profile-based Proactive、Parallel On-demand、Speculative Transfer)实现无缝分离推理
ResKV 将固定 KV 预算划分为精确主缓存和紧凑残差缓存,通过共享 softmax 重建被丢弃 token 的注意力贡献,显著提升长上下文推理效率
HAM-VLN 为 zero-shot VLN agent 提供决策耦合的层次化记忆系统,通过世界图存储导航历史,结合动态门控检索,在无需训练的情况下超越现有方法
MiniWorld 提出轻量级可复现的视频世界模型训练框架,基于块因果 Video DiT + Flow Matching + 块级非递减噪声调度 + 滚动 KV Cache 流水线异步去噪,可在单台 8-GPU 服务器上数天内完成训练
Resource-Fair Scheduling 将 LLM 推理中的 batching 外部性形式化为资源公平问题,提出 LJF 和 ISJL 两种公平调度算法,并建立利润分解理论将吞吐量与线性定价下的运营成本对齐
TRAINCHECK — 通过自动推断训练不变量并主动检查,在训练过程中提前发现静默错误(OSDI 2025, University of Michigan)
PaletteID 提出基于原型的语义标识符(PID),通过 SQ-DPP 从多模态商品嵌入中选择原型调色板,保留连续语义信号,提升 CTR 预测的长尾泛化能力
NVIDIA Nemotron 3 系列(Nano/Super/Ultra)—— 混合 Mamba-Transformer MoE 架构,NVFP4 训练,LatentMoE,MTP,多环境 RL,1M token 上下文
A canvas-native creative agent harness for long-horizon multimodal creation, unifying project state, controlled runtime execution, and trajectory recording
BF16下KV缓存的增量构建与一次性prefill虽然token相同但产生不同轨迹;FP32消除分歧;双向K/V缓存移植使所有分歧轨迹跟随donor
A physical world model that learns a compact discrete 'physical language' from in-the-wild videos, then uses a reason-then-render paradigm to generate and understand physically coherent video
多块预测(MCP)训练框架,通过轻量辅助模块同时去噪多个未来视频块,加速世界动作模型训练与推理
Marvell Photonic Fabric Memory Appliance — 用无源光纤全互连拓扑替代电交换机,实现32TB共享DDR5内存的CXL内存池化
CXL-Hybrid Memory-based remote KV-cache tier for scalable multi-turn LLM serving
FSA 通过交换 NSA selected attention 内核的两层循环顺序(从 query 分组改为 KV 块分组),消除小 GQA group 下的 padding 浪费,实现最高 3.5× 内核加速、1.25× 端到端训练加速。
2.8T 参数原生多模态 MoE、104B 激活参数、1M token 上下文、Kimi Delta Attention + Attention Residuals + Stable LatentMoE 的开源前沿模型
A training-free framework for revisit consistency in autoregressive generative rendering using correspondence-guided memory and geometric attention priors"
Computational Analysis of Optimal Scaling Laws for Native Multimodal Pre-Training Under Fixed Budget Constraints
A selective KV recomputation method using attention-norm criteria from query to context tokens to identify information-flow-critical tokens for long-context inference
A novel fused Indexer-TopK kernel that exploits the curse of dimensionality to accelerate sparse attention in long-context LLM inference, achieving up to 3.38x speedup on B200.
AAFLOW+系统将KV缓存作为一等分发系统对象,实现零拷贝的多智能体工作流执行状态共享
面向AI加速器的LLM Token阶段优化框架FastTPS,包括全局KV缓存管理、序列维度扁平化、Fusion MLP等技术
A fast, memory-efficient pure-Transformer video decoder that decodes latents to pixels frame by frame using a rolling KV cache, achieving 3.6x-4.7x faster throughput and up to 11x less GPU memory compared to convolutional decoders.
Training-free parallel decoding framework for block-wise diffusion LLMs using gated wavefront execution and heterogeneous wavefront packing
面向视频 DiT 推理的训练无关稀疏注意力系统,通过运行时负载均衡(RLB)和松弛感知稀疏增强(SASA)解决 Top-p 路由在多 GPU 序列并行下的负载不均衡问题
Cost-Efficient Remote KV-Cache Tier Using CXL-Hybrid Memory for Scalable LLM Serving
A KV Cache Framework for Multi-Turn LLM Serving with CXL-Hybrid Memory
A selective KV recomputation method using attention-norm criterion and inference-consistent RoPE ordering for long-context LLM/VLM inference
提出了一种基于Wasserstein DRO的鲁棒KV cache管理框架,联合优化GPU并行配置、KV cache预留、请求路由和前缀缓存,在输出token长度不确定性下实现自适应内存分配和尾延迟控制。核心贡献包括临界分位数结构理论证明、BCD-DRO分解算法和滚动时域自适应策略。
A robust KV cache management framework using Wasserstein distributionally robust optimization (DRO) to jointly optimize GPU parallelism, cache reservation, request routing, and prefix caching under output token length uncertainty.
面向 LLM 训练的 GQA-based blockwise sparse attention 机制,通过轻量 Index Branch 实现 per-GQA-group Top-k 选择,在 109B MoE 模型上实现 28.4× FLOPs 减少和 14.2× prefill / 7.6× decoding 加速
A runtime memory-management system for MoE LLM serving that dynamically quantizes expert weights at runtime to balance GPU memory between model weights and KV cache, using a quality-aware planner with offline sensitivity, online routing statistics, and prompt residuals.
一种基于 EMA 预测器和在线 Softmax 增量修复的投机注意力运行时,打破 DSA 中 selection-to-attention 的关键路径依赖
Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding
Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding via Speculative Execution and Incremental Repair
基于 Johnson-Lindenstrauss 引理的旋转二进制量化 KV Cache 框架,通过高吞吐 binary-INT4 算术实现无偏代理分数估计,支持自适应 Top-p 检索,在长上下文推理中实现 2.16× 端到端加速且精度几乎无损
A streaming inference framework enabling real-time 50Hz control for Flow Matching Vision-Language-Action models via partitioned attention, AdaRMSNorm, and async pipeline
Model-agnostic extractive prompt compression framework using sentence-frequency-ordered lexical trie to prevent theme collapse under tight budgets
在华为昇腾 NPU SuperPOD 上对万亿参数 MoE 模型(DeepSeek-V4)进行全参数后训练的系统优化与面向运筹学的 CPT-SFT 工作流
Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
A speculative decoding runtime for stateful linear-attention models that verifies chains and trees with topology-aware kernels, stores compact factors to recover accepted states, and uses confidence pruning plus a target-aligned EAGLE-style drafter.
A single VLA with bidirectional speed control via Variable-Speed Trajectory Augmentation (VSTA) and explicit speed conditioning, enabling on-demand acceleration/deceleration without retraining
作为预训练长上下文 Transformer 的即插即用分层路由算法,保留原始注意力投影,仅通过查询-键内容路由选择历史 token 进行精确 token 级注意力计算
面向同步 Agentic RL 的 workload-aware rollout 系统,通过 model-free speculative decoding (SuffixDecoding) 和 cache-aware scheduling 联合优化解码与调度
基于 Wasserstein DRO 的鲁棒 KV Cache 管理框架,联合优化 GPU 并行配置、缓存预留、请求路由和前缀缓存
快手 OneRec 提出的序列级语义压缩注意力,通过可学习 summary token 实现 O(n/k) 的 KV Cache,长上下文精度匹配或超越 Full attention
面向 LLM 推理的 HBF(高带宽闪存)与 HBM GPU 软硬件协同设计:通过架构级 SRAM 缓存/预取、专用数据布局与异构存储管理层,将 HBF 的容量优势转化为吞吐与能效。
针对大规模 MoE LLM 推理中数据移动瓶颈的首次全面 profiling 分析,提取六大系统级洞察并在未来晶圆级 GPU 架构上验证
First generative game engine combining multi-player control, real-time inference, complex physical interaction, and adversarial gameplay in KOF '97
基于低秩约束 SDP 松弛的非凸方法,突破 LP 验证器的凸松弛屏障
使用 INT8 量化注意力计算 + K 平滑 + FP16 累加器的即插即用推理加速方法
使用 INT4 线程级量化和 FP8 矩阵乘加速注意力计算,配合 Q+K 平滑与两级累加策略保持精度
基于分层 Top-p 剪枝的自适应注意力稀疏框架,加速长上下文 LLM 推理
训练无关的通用稀疏注意力,加速所有模型推理(语言、图像、视频生成)
首个 FP4 微缩放注意力推理加速与 INT8 可训练注意力探索
基于 FP8 Matmul + FP16 累加器指令进一步加速 SageAttention2 的注意力量化内核实现,在保持精度的同时取得相对 FlashAttention 最高 3.9× 加速。
将稀疏注意力与线性注意力融合的 trainable attention 方法,用于加速 DiT 视频生成模型
基于分层 Top-p 的稀疏注意力框架,通过聚类级估计 + Token 级自适应分配优化长上下文 LLM 推理
系统研究表明,经过精心筛选和标注的拟人视角(egocentric)人类视频作为具身基础模型预训练数据源,可显著超越遥操作真实机器人数据
训练高效的自压缩框架,利用预训练 VLM 自身作为内在编码器压缩视觉 token
基于 Wan-1.3B 的生成式格斗游戏引擎,首次实现多玩家控制、实时推理、复杂物理交互和对抗性玩法的统一
A generative game engine built on Wan-1.3B that simulates real-time two-player KOF '97 gameplay from keyboard input, achieving 30 FPS on a single RTX 5090 with streaming autoregressive generation, player association via CLIP, and 4-step DMD distillation.
A stateful extension of agentic workflow operators that elevates KV cache to a first-class distributed systems object, enabling zero-copy, transfer-aware execution for multi-agent LLM workflows.
一个因果视频生成世界模型,实现无限长、实时响应的交互式世界模拟,支持多种角色动作和环境事件,并引入Pilot-Director双智能体协作框架
TriRoute — 单一轻量控制器联合决策注意力分辨率、FFN 专家选择与 KV-Cache 位宽,端到端可训练,单一预算旋钮扫出 Pareto 前沿,缓解跨轴路由坍缩级联
LingBot-Video — 首个开源大规模 MoE 视频基础模型,面向具身智能的单流扩散 Transformer,稀疏 MoE + 五阶段课程预训练 + 多维奖励 GRPO 后训练
Jointly trained conditional and unconditional diffusion model enabling guidance without a separate classifier, achieving similar quality-diversity tradeoff as classifier guidance with simpler training
ByteDance/Tongyi Lab's IV-VAE introduces Keyframe-based Temporal Compression and Group Causal Convolution to achieve SOTA video reconstruction with balanced inter-frame performance
Internet-scale JEPA video model pretrained on 1M+ hours of video, achieving SOTA understanding benchmarks and enabling zero-shot robotic planning via action-conditioned post-training with <62h robot data
GPU-initiated NVSHMEM redesign of GROMACS domain decomposition halo exchange, fusing data packing and communication to eliminate CPU-GPU sync bottlenecks and improve strong scaling by up to 2x
ByteDance's FSVideo achieves 42.3x speedup over Wan2.1 via 64×64×4 compression autoencoder, layer memory self-attention DIT, and few-step latent upsampler
Next-gen JEPA model with dense predictive loss, deep self-supervision, and multi-modal tokenizers achieving SOTA on dense visual tasks (depth, segmentation, STA) while retaining global scene understanding
First stable end-to-end JEPA that trains from raw pixels using only two loss terms (prediction + SIGReg), with ~15M params on single GPU, 48x faster planning than foundation-model world models
Frequency-guided and hardware-aware KV Cache reuse system achieving 3.72x-4.86x TTFT speedup and 3.93x-6.21x higher throughput via selective recomputation of semantic-critical tokens
字节跳动提出的首个基于潜空间扩散模型(LDM)的高效文生视频框架。通过在低维潜空间建模视频分布、复用文生图模型的 2D 卷积权重、引入帧级轻量 adaptor 与有向时序注意力,MagicVideo 在单卡上生成 256×256 视频,FLOPs 较 VDM 减少约 64×。
Lightricks 提出的实时文/图生视频模型:把 patchify 操作从 Transformer 输入端移入 Video-VAE,实现 1:192 高压缩(32×32×8 时空下采样 + 128 潜通道),并让 VAE 解码器承担最后一步去噪,无需额外超分模块。1.9B 参数即可在单张 H100 上以 2 秒生成 5 秒 768×512@24fps 视频(快于实时),人评 T2V 胜率 85%、I2V 胜率 91% 显著超越同量级开源模型。
从理论与实证两方面证明:把 GPU 张量核心(Tensor Core)用于访存受限(memory-bound)kernel 无法带来实质性能收益。核心理论:基于 Roofline 模型与机器平衡度(machine balance)推导,在完全不重叠(fully un-overlapped)极端情形下张量核心相对 CUDA 核心的加速上界为 Speedup < 2 − 2/(1+α);对于 FP64(张量核心算力 α=2,即 V100/A100/H100)该上界仅为 1.33×,即便 α→∞ 也不超过 2×。完全重叠情形下访存主导、计算加速对总时间无影响。实证在 A100 与 GH200 上用 STREAM SCALE、SpMV(cuSPARSE vs DASP)、迭代 stencil(EBISU/Brick vs ConvStencil/LoraStencil)三类代表性访存受限 kernel 验证:张量核心实现普遍慢于同等优化的 CUDA 核心实现,主因是张量核心访存模式次优。结论:访存受限 kernel 应优先用 CUDA 核心并聚焦访存优化(cache-aware、减少访存流量、流水/重叠),而非引入张量核心。
A performance model using differential equations to accurately predict execution time of warp specialization kernels, enabling optimal tile configuration search via Z3 SMT solver
用微基准测试解剖 NVIDIA Blackwell 消费级 GPU(GeForce RTX 5080, GB203)架构,并与上一代 Hopper(H100 PCIe, GH100)逐子系统对比——涵盖统一 INT32/FP32 核、精简 FP64、第五代张量核心(FP4/FP6)、内存层次(L1/L2/global)与真实负载(D-GEMM、Transformer 推理)功耗。
An analytical performance model (LIMINAL) that abstracts application requirements and hardware capabilities to systematically explore LLM inference performance limits across current, near-future, and hypothetical hardware
字节跳动 Waver 团队的统一图像/视频生成基础模型:基于 Rectified Flow Transformer,用 Hybrid Stream DiT(Dual Stream 前 16 层对齐模态 + Single Stream 后 40 层提效)在单一网络内统一 T2V/I2V/T2I,原生生成 720p 5–10 秒视频再经 Cascade Refiner 级联超分到 1080p(提速 40%)。配套 MLLM 视频质量模型的数据清洗流水线、REPA 表征对齐、mode 时间步采样、192p 运动预训练、视频 APG、模型平均等训练/推理配方,在 Artificial Analysis T2V/I2V 榜单双双第三,复杂运动场景显著领先。
AMD 提出的 Chopper 多粒度 GPU 剖析框架,对 8 卡 MI300X 上 Llama 3 8B 的 FSDP 训练做端到端表征,揭示频率开销(DVFS)是理论与实测性能差距的最大来源。
arXiv 2512.18134,来自 CudaDMA/Singe 同一血统的团队(Bauer/Aiken + Stanford/NVIDIA/Toronto)。首次把软件流水线(Software Pipelining, SWP)与 warp 特化(Warp Specialization, WS)表述为一个可交给现成约束求解器求解的联合优化问题。核心洞见:SWP 与 WS 不应分开处理——WS 恰恰是实现 Tensor Core GPU 上 SWP schedule 所必需的代码生成手段(解决多 warp 协作发射 TC、寄存器工作集、变长延迟操作、阻塞同步中断四大难题)。方法上先用模调度(modulo scheduling,ℤLP 最优求解)得到初始 initiation interval I 与 modulo schedule M,再将 M/I 展开为一段直线程序 Q,在其上叠加 SWP 约束(Uniqueness/Consistency/Completion/Dependence/Capacity)、内存感知约束(活跃变量 live 传播 + 内存容量/SSA)、warp 分配约束(Warp Uniqueness/Variable Latency/Register Limit/Cross-Warp Spills/Concurrency),交给 SMT 求解器(Yices2 QFLIA)联合求解得到 M*、I*、A*。关键实现技巧:成本归一化(cycle count 比值保持的 ℤLP,令问题可解)、变长流式操作(TMA load)零延迟建模 + 深度作为 autotuning 参数、不可满足时单调增大 I/L 重试。系统 Twill 从 Triton TTGIR 抽取依赖图,无启发式、易扩展新架构、对单层循环保证最优。评估在 H100(Hopper)/B200(Blackwell) 上对 Flash Attention 前向/后向传播自动重新发现 FA3(ping-pong scheduling)与 FA4(三组 warp 策略)专家手工方案,性能达 cuDNN/FA 手工实现的 1%~2% 以内。
LingBot-World, an open-sourced world simulator stemming from video generation, featuring minute-level horizon, real-time interactivity, emergent memory, and three-stage evolutionary training pipeline
Thong Thanh Nguyen 的博士论文,从时间维度系统性地推进视频理解,围绕三大研究目标(推进边界 / 高效捕获时间 / 有效捕获时间)提出五项贡献:(1) MAMA 用减性角度间隔对比 + 元优化样本加权自动标注海量视频;(2) READ 在轻量适配器瓶颈内嵌 RNN,仅微调适配器即在低资源时间定位/视频摘要上超越全量微调;(3) GSMT 用门控状态空间模型(SSM)对密集采样帧建全局语义,配套 Ego-QA/MAD-QA 长视频问答基准;(4) MCL 用运动感知对比学习 + 强运动 tube 选择做时间全景场景图;(5) MSCL 多尺度跨尺度对比 + 特征金字塔做时间定位;并给出面向时间的 LVLM 训练配方(QueryFormer 接口 + 时间训练方案 + 记忆库 + MoE 四步扩展)。
CGO 2026 预印本 arXiv 2604.07857。Cornell + NVIDIA 团队(与 Tawa 同作者群)。这是一篇综述论文,系统梳理了 Agentic AI(感知-推理-行动闭环智能体)的能耗挑战与优化方法。核心贡献:① 提出**能量核算框架**,将 Agentic AI 能耗拆解为**计算能量**(FLOPs + 内存访问,DRAM 访问 ~640 pJ vs 算术 <1 pJ)和**通信能量**(token 传输、中间结果交换、多智能体同步)两大瓶颈;② 建立**统一分类学**,四大支柱:模型简化(量化/剪枝/蒸馏/稀疏 MoE/动作简化)、计算控制(token 长度控制/早退/层跳过/解码简化/工作负载调度)、输入与注意力优化(token 剪枝/稀疏注意力/KV 缓存复用)、硬件感知推理(精度调度/DVFS/内存 I/O 优化);③ 探讨**跨层协同设计**:跨层优化变量(传输-推理耦合/移动感知调度/模型-信道自适应)、用户-边缘-云协作(分割推理/自适应卸载/协作缓存)、通信-推理联合设计(语义通信/RAG 通信/能量感知调度);④ 识别五大开放挑战:不确定性量化自适应推理、跨模态/跨智能体协作能效、绿色 AI 与性能权衡、联邦绿色学习、碳感知智能体、6G 原生 Agentic AI、能量收集自维持系统。
A comprehensive survey of world models from a robot-learning perspective, examining policy coupling, learned simulators for RL and evaluation, robotic video generation, and benchmarks/datasets across embodied applications
面向大规模视频扩散 Transformer(DiT)的稀疏注意力加速框架。核心洞见:生成质量并非由稀疏率本身决定,而取决于稀疏掩码与全注意力 tile 级几何结构的对齐程度。Veda 把 tile 选择建模为对全注意力的显式重建问题:(1) 蒸馏式 tile 打分——用轻量估计器从全注意力 backbone 蒸馏 tile 级分数,配合 TripPool(Avg/Max/Min 三元统计)与逐头 MLP 投影降低估计误差,训练时对 backbone 特征做 stop-gradient 解耦掩码学习与特征学习;(2) 逐头 tiling 搜索(Head-aware Tiling)——为每层每头分配 (p_t,p_h,p_w) 分块配置以最小化稀疏输出与全注意力输出的 Frobenius 误差;(3) 硬件高效 tile-skipping kernel(ThunderKittens/Hopper TMA+Warp Specialization,达 FA3 80% MFU)。在 Waver-T2V-12B 720P 10 秒视频上取得 5.1× 端到端、10.5× 自注意力加速,注意力开销从 92% 降至 50%,且序列越长收益越大。
A test-time adaptation framework that performs lightweight updates within the closed loop of Model Predictive Control (MPC) to continuously recalibrate a JEPA world model during deployment
A software library that heuristically determines optimal tile sizes and queue configurations for TMA-based GPU kernels using the GPU Specification Table (GST) and Little's Law
NVIDIA Blackwell GPU 架构的综合技术综述——涵盖第五代张量核心(tcgen05、FP4/FP6)、张量内存 TMEM、硬件解压引擎 DE、重构内存层次(L1/L2/HBM3e/GDDR7)、双芯 B200 互连,以及与 Hopper/H200 的微基准对比与调优策略。综合自 Jarmusch et al. 两篇微基准论文。
SC11 经典论文,提出 CudaDMA——一个通过 warp 特化(warp specialization)优化 GPU 显存带宽的可扩展 C++ 头文件库。核心思想:把一个 CTA(线程块)内的 warp 分成两类——DMA warp 专门负责片外 DRAM 与片上 shared memory 之间的数据搬运,compute warp 专门负责计算,从而把数据传输的形状/维度与计算的形状/维度解耦。DMA warp 借助 float4 向量化访存、指针算术外提、细粒度命名屏障(PTX bar.arrive/bar.sync)生产者-消费者同步,仅用 4 个 DMA warp/SM 即可饱和内存带宽(vs 基线需 40 warp)。提供 cudaDMASequential / cudaDMAStrided / cudaDMACustom 三类实例与单缓冲/双缓冲/手动双缓冲三种缓冲策略。在 NVIDIA Fermi (Tesla C2050) 上,微基准最高 1.37×,SGEMV 最高 3.2×、3D 有限差分 stencil 1.15×,FFT 通过降低占用率省寄存器。
Meta 提出的容错混合分片数据并行 FT-HSDP:以数据并行副本为容错单元,通过 CPU-GPU 混合 FTAR 全归约与非阻塞追赶协议实现异步恢复,在 10 万 GPU 规模将有效训练时间从 44% 提升至 80%。
Michael Brenndoerfer《GPU Architecture:Memory Hierarchy, CUDA and Tensor Cores》全文中文翻译。从第一性原理讲解 GPU 内存层次与带宽阶梯、CUDA 核心与 SM/warp/SIMT 执行模型、张量核心 WMMA 与混合精度、Roofline 模型、GPU 规格解读、消费级 vs 数据中心 GPU,以及内存/带宽/精度/功耗四大实际约束,附 PyTorch 代码示例。
UNT 与 William & Mary 提出的纯硬件 GEMM 卸载方案:在张量核心执行 GEMM 时,将部分 WMMA 指令翻译为 MAC 指令下放到空闲的 CUDA 核心并行执行,配合额外 load-store 单元缓解访存瓶颈,在 GPGPU-Sim 上最高提升 29% 性能,CUDA 核心利用率从近零提升至平均 ~73%。
A prefetch-aware (PA) warp scheduling policy that coordinates thread scheduling and data prefetching in GPGPUs to better tolerate long memory latencies
PPoPP'14 论文,来自 CudaDMA 同一作者团队(Bauer/Treichler/Aiken, Stanford)。提出 Singe——一个面向燃烧化学(combustion chemistry)的 DSL 编译器,用 warp 特化(warp specialization)作为替代数据并行的编程模型,把一个 CTA 内的 warp 划分为不同子计算,通过硬件生产者-消费者命名屏障(named barriers, PTX bar.arrive/bar.sync)细粒度同步。核心解决燃烧 kernel 的三大难题:超大工作集(每点数百个双精度变量)、不规则计算(多阶段、部分可并行)、不规则访存。Singe 用 warp 特化把大工作集拆分到不同 warp 的片上寄存器/shared memory,避免寄存器溢出。三类 kernel 案例:Viscosity(按物种求和分块,Store 模式)、Diffusion(对 dij 矩阵按列分块,Mixed 模式)、Chemistry(反应速率存寄存器经 shared 交换,Buffer 模式 + QSSA DAG 分块 overlap)。编译器四阶段:分块→映射(FLOPS/寄存器/局部性三指标)→命名屏障放置调度(无死锁定理,16 个命名屏障=SSA 寄存器分配)→代码生成。代码生成三关键技术避免指令 cache 抖动:代码 overlay(同时遍历 AST 森林 + 位掩码/间接分支)、常量去重(Fermi shared 广播 / Kepler shuffle)、warp 索引(不规则访存)。在 Fermi C2070 与 Kepler K20c 上对 DME/Heptane 机制,相比已高度优化的数据并行 baseline 最高加速 3.75×。
CGO 2026 论文,Cornell + NVIDIA 合作。提出 Tawa——首个面向现代 NVIDIA GPU(Hopper+)的**全自动 warp 特化编译流程**,从未经修改、无标注的 Triton 程序出发,自动分区为 producer/consumer warp group,自动管理软件流水线。核心创新是**异步引用(asynchronous reference, aref)**——一种形式化语义保证的 IR 抽象,将 warp 间通信建模为带硬件 mbarrier 的单槽信道(put/get/consumed),封装 TMA 描述符配置、mbarrier 初始化/相位管理等底层细节。编译器三步变换:① 基于语义标记的任务感知分区(iteration stmt → producer, tile stmt → consumer,依赖闭包 + 计算复制);② 基于 aref 的多槽环形缓冲自动构建跨 warp 数据流;③ 多级软件流水线(细粒度:CUDA 地址计算与 MMA 重叠;粗粒度:CUDA Core 变换与 TC 流水线装配线)。额外优化:协作计算 warp group(多 WG 共享 tile 寄存器预算)、持久化 kernel。在 H100 上:GEMM 达 cuBLAS 水平(FP16 +1.01×,FP8 +1.06×);Attention 达 FA3 手工优化内核的 96%,超 Triton 1.21×。ablation 显示 +Auto WS 提升 3.78×,最终 GEMM 达 718 TFLOPs/s(baseline 的 ~7×)。
Chinchilla论文提出计算最优的LLM缩放定律:模型大小和训练token数应按同等比例缩放(各为C^0.5),发现当前LLM严重欠训练,Chinchilla(70B/1.4T)在相同计算量下显著超越Gopher(280B)/GPT-3(175B)。
无仿真训练连续归一化流(CNF)的新范式:通过回归条件概率路径的向量场,统一并超越扩散模型,并引入最优传输(OT)路径
DiT 用在 latent patch 上操作的 Transformer 替换扩散模型常用的 U-Net 骨干,提出 adaLN-Zero 条件注入块,证明 Gflops(通过增大深度/宽度或 token 数)与 FID 强负相关;DiT-XL/2 在 ImageNet 256×256 取得 SOTA FID 2.27,是 Sora/SD3/FLUX 等现代生成模型的架构基石。
Video LDM (Align your Latents) 将 LDM 范式扩展到高分辨率视频生成——先在图像上预训练,再冻结空间层、插入并只训练时序对齐层(时序注意力 + 3D 卷积),把图像生成器转为视频生成器;同时时序微调解码器与超分模型,将 Stable Diffusion 变为最高 1280×2048 的文生视频模型,并首次实现个性化文生视频。
Stability AI 的 SD3 论文:改进的 Rectified Flow 时间步采样 + 多模态 MM-DiT 架构,在高分辨率文生图上超越 DALL·E 3 等 SOTA
Meta 的 Movie Gen 媒体基础模型全家桶:30B 文生视频 + 13B 视频音频生成,Flow Matching + LLaMa3 风格 Transformer,支持 1080p HD 视频、同步音频、个性化与指令式视频编辑,多任务达到 SOTA。
腾讯混元视频生成基础模型,130亿参数,涵盖数据清洗、架构设计、渐进缩放训练和高效基础设施,综合性能超越Runway Gen-3和Luma 1.6等闭源模型。
LinGen 用线性复杂度的 MATE 模块(Bidirectional Mamba2 + TESA)替换 DiT 中二次复杂度的自注意力,首次实现单 GPU 上高分辨率分钟级视频生成,最高 15× FLOPs 加速。
PSA提出渐进式稀疏注意力机制,通过阈值驱动的自适应KV块选择替代固定top-k策略,结合流水线迭代执行和统一内存管理,在保证精度的同时最大化推理吞吐。
Adrenaline提出注意力分离与卸载机制,将解码阶段的注意力计算卸载到预填充实例,解决PD分离导致的资源利用率低下问题,最高提升1.68×推理吞吐。
PPFlow 用金字塔分块化(高噪声时间步用大 patch、低噪声时间步用小 patch)替换 DiT 固定 patch size,仅切换 Patchify/Unpatchify 线性投影而共享 DiT blocks,实现 1.6–2.0× 去噪加速且质量不降,从预训练模型适配仅需 +8.9% 训练 FLOPs。
TaiChi提出一种统一的LLM推理服务系统,通过混合模式推理和延迟迁移调度策略,在任意TTFT和TPOT SLO组合下实现最优goodput。
腾讯混元原生多模态模型:在自回归框架内统一多模态理解与生成,80B MoE(激活 13B),当前最大最强开源图像生成模型
腾讯轻量级开源视频生成模型,仅83亿参数即达SOTA视觉质量,支持SSTA稀疏注意力加速、视频超分到1080p、消费级GPU推理
DDiT 提出测试时(training-free)动态分块策略——根据内容复杂度与去噪时间步自适应调整 patch size:高噪声步用粗 patch 建模全局结构、低噪声步用细 patch 精修局部细节;通过三阶有限差分度量潜表示演化速率驱动调度器,在 FLUX-1.Dev / Wan 2.1 上实现最高 3.52×/3.2× 加速且不损画质。
DC-DiT 用学习式 encoder-router-decoder 支架替换扩散 Transformer 的固定 patchify,端到端学习内容自适应的动态分块 tokenization,实现跨空间/时间步的自适应计算与单一 checkpoint 弹性推理,FLOPs 降低 36.8%、FID 提升 37.8%。
面向 PD 分离式 LLM 服务的负载感知 Prefill 偏转调度器 Kairos:让 decode 节点以 chunked-prefill 方式代跑 prefill,消除跨节点 KV 传输,P95 TTFT 最高降低 81%。
Mario Larcher 在 Towards Data Science 对 DiT 论文《Scalable Diffusion Models with Transformers》的教学式讲解精读,含扩散公式、无分类器引导、潜在扩散、Patchify、adaLN-Zero 等背景与核心设计
Tree-structured speculative rollout cache for RL that eliminates redundant computation across rollouts, enabling faster policy optimization
End-to-end TPU migration for Gemma 4 31B: 1.61× faster training at 2.12× lower cost, with 66% higher long-context inference throughput
Patch-level pipeline parallelism for DiT inference that eliminates pipeline bubbles and enables PCIe-scale multi-GPU inference at 8K resolution
Position persistent sparse attention leveraging spatial coherence of high-attention tokens across Transformer layers for 2.1× decoding speedup
rRCM reformulates generative denoising as discriminative latent-space learning for certified robustness with 85× speedup
Autoscaling framework using token velocity metric and convertible decoders for 80-96% SLO attainment in disaggregated LLM serving
A quantitative analysis of FP8 E4M3 attention P-casting revealing P-collapse under attention sink and characterizing S=256 as the optimal static scaling factor
A general-purpose interactive text/image-to-video world model supporting camera navigation, scene revisits, and promptable events with 16 FPS streaming on 8x RTX 5090
MrFlow achieves 10x+ training-free acceleration for flow-matching diffusion models via a four-stage low-to-high resolution pipeline
受人类前瞻性思维启发的强化学习方法:智能体通过动态模型对若干动作序列进行 n 条虚拟轨迹的前向想象,结合模型预测控制(MPC)挑选高价值动作;再以循环一致性约束状态可逆性,避免不可逆事件并生成大量虚拟轨迹提升数据效率。在 DMControl-100k 六个环境中取得五项最好成绩,中位数分数 807.5,比 PlayVirtual 提升 8.32%,比 CURL 提升 44.20%。
A benchmark framework for evaluating LLMs' ability to generate fast and correct GPU kernels across 250 PyTorch workloads
针对 PyTorch 中 CUDA Graph 部署困难的编译器框架。提出三项优化:CGCT(自动代码变换使 ML 程序兼容 CUDA Graph)、PI(参数间接寻址将数据拷贝转为指针拷贝,最高减少 99% 拷贝量)、SCG(基于成本效益分析的有选择部署)。在 25 个 ML 工作负载上,PyGraph 比 PyTorch2-CG 平均提速 29%,最高 3.36×,且在分布式 Tensor Parallelism 下表现更强。
从动作 tokenization 视角统一审视 VLA 模型的综述。提出 VLA 模块 + 动作 token 的统一框架,将现有 VLA 模型归为 8 种动作 token 类型(语言描述/代码/可供性/轨迹/目标状态/隐表示/原始动作/推理),逐一分析每种类型的优势、局限与未来方向,并提出分层架构趋势与从 VLA 模型到 VLA 智能体的演进路径。
A systematic analysis of NVIDIA NCCL's internal architecture covering API, protocols, transports, and collective algorithms
TetriServe 针对异构分辨率、紧 SLO 的 Diffusion Transformer 在线服务,首创 step-level sequence parallelism:把连续时间轴离散为固定长度轮次,先用剖析驱动的成本模型为每个请求求最小 GPU-hour 分配以满足 deadline,再以'避免必迟到'为目标做请求打包。相较固定 SP baseline,SLO Attainment Ratio 最高提升 32%,覆盖 FLUX.1-dev 与 SD3、H100 与 A40,稳定应对突发流量。
面向真实世界部署的 VLA 全栈综述。系统梳理 VLA 三大挑战(数据稀缺 / 具身迁移 / 算力成本)、架构演进(CNN→Transformer→VLM→Diffusion/Flow→分层控制),并给出三类核心架构(sensorimotor 7 变体 / world model 3 模式 / affordance 3 模式)、模态处理(视觉/语言/动作/音频/触觉/3D)、训练范式(SL/SSL/RL + 预训练/后训练/梯度隔离/LoRA)、数据采集(遥操作/代理设备/人类视频)、公开数据集(Ego4D/OXE/DROID/AgiBot World)、机器人平台与评测基准(LIBERO/CALVIN/ManiSkill/SIMPLER/RoboArena)。最后给出面向实践者的 6 条建议与 8 个未来方向。
ProServe 将多优先级 LLM 服务形式化为服务增益最大化问题,提出 Token-level Deadline-aware Gain (TDG);引擎层 SlideBatching 用滑动 urgent/normal 边界结合密度与截止时间排序,服务层 GoRouting 做增益导向、感知能力的分发,跨四个开源数据集与工业追踪相对 SOTA 系统增益提升最多 35%、SLO 达成率提升最多 52%。
Nightjar 将投机长度选择建模为上下文多臂赌博机(Contextual MAB),按 batch 大小自适应选择 γ 或彻底关闭投机,并在高负载下把 draft 模型 offload 到 CPU 释放显存扩大 KV cache;在动态请求率下相比标准 SD 吞吐提升最高 14.76%、延迟降低最高 20.18%,相比无 SD 平均提升 27.29%。
小米 309B 总参 / 15B 激活的 MoE 推理与 Agent 大模型。混合注意力(5:1 SWA:GA,128 窗口 + 可学习 attention sink,KV/算力近 6× 缩减),27T token 预训练 + MTP,原生 32K 扩展到 256K。提出 Multi-Teacher On-Policy Distillation (MOPD):多领域 RL 教师提供 token 级 KL 稠密奖励 + ORM 结果奖励,学生在自身分布上蒸馏多专家。以 1/2、1/3 的参数比肩 DeepSeek-V3.2 与 Kimi-K2;SWE-Bench Verified 73.4%。三层 MTP 做自投机解码,接受长度达 3.6、解码提速 2.6×。
PASTE 通过 Pattern Tuple 抽象从历史执行中挖掘控制流与数据依赖,基于风险感知的机会式调度在 LLM 生成阶段就投机执行未来工具调用;跨深度研究、编码、科学 agent 工作负载将端到端任务完成时间平均降低 43.5%,工具延迟降低 1.8×,验证空闲达 10×。
RouterWise 首次将多模型 LLM 路由与 GPU 资源分配联合建模,通过对偶价格公式化的分数最大化路由 + setup 特化的延迟分析模型,搜索可行的 tensor 并行/GPU 线程份额组合,在满足延迟 SLO 前提下最大化输出质量。实验表明同一 GPU 集群下不同 setup 的可达质量差异高达 87%,证明资源分配是路由性能的关键决定因素。
RateQuant用率失真理论把KV cache按注意力头分配bit宽度:假设量化MSE满足$D(b)=\alpha\beta^{-b}$,用reverse waterfilling闭式求最优分配,并识别distortion model mismatch这一失效模式——不同量化器$\beta$从3.6到5.3变化,套错模型比uniform更差。校准per-quantizer $\beta$并对K/V单独分配预算后,Qwen3-8B在KIVI 2.5bit的PPL从49.3降到14.9(−70%),QuaRot改善6.6 PPL;全流程校准仅1.6秒,推理零开销。
Tangram 利用「Head-wise 保留量存在输入无关的两级结构」的观察,把非均匀 KV 压缩静态化:Budget Reservation 在调度时固定每头预算、Ragged Paging 用同预算 head 组成独立 page 表消除碎片、AOT Load Balancing 预算 CTA 划分。作为 vLLM drop-in 层,在五个模型 SCBench 上匹配原精度同时端到端吞吐相较 Full-KV 最高提升 2.6×。
首次系统性研究GPU上LLM推理引擎的软件老化现象。以三种部署栈(vLLM standalone/Triton+vLLM/PyTorch+HF)在NVIDIA L40S上做6×36小时=216小时压力测试,结合Mann-Kendall/Theil-Sen统计流水线,发现所有部署均存在统计显著的进程私有内存泄漏,泄漏率跨约两个数量级(1.8→157 KB/h),且最脏配置为Triton包裹的旧V0引擎。
M* 提出 Walk Graph 抽象把组合式多模态模型建模为组件级 dataflow 图 + 命名 Walks;请求成为图上的遍历。四种组合原语(Sequential/Parallel/Loop/DynamicLoop)与流式边策略统一表达 UMM、Omni、SpeechLM、VLA 与世界模型。BAGEL T2I 端到端延迟低 20%,Qwen3-Omni TTS RTF 快 2.9×、吞吐高 2.7×,V-JEPA 2 机器人 rollout 提速 12.5×。
GF-DiT 把 GPU 并行度视为一等可调度资源,将 DiT 请求拆为可独立调度的 trajectory tasks 并支持在线 GPU 重分配;提出 group-free collectives 用符号缓冲区 + 边协商实现毫秒级动态通信组,把 communicator 建立时间从 778 ms 降到约 60 μs;相比静态并行 pipeline 吞吐提升最多 6.01×、平均延迟降低最多 95%、SLO 违约率降低最多 90%。
Gimbal 为 MoE LLM 推理设计跨层协同调度:前端基于 KV / prefill / 队列 / 专家压力的细粒度 DP 引擎选择 + 引擎内 SJF+aging 队列;后端结合源感知路由统计与 MINLP 校准的启发式专家放置,实现前后端反馈闭环,在 vLLM 之上将 TTFT 降 42.9%、TPOT 降 33.3%,高负载吞吐提升 3.0%。
将 LLM 连续批处理下的 KV-Cache 内存增长建模为离散动力系统,证明同质负载下无驱逐平衡点不稳定,最坏极限环吞吐损失可达 50%;异质负载在共素解码长度下才能稳定;给出速率限制准入与请求混合两种消驱逐策略。
Tropical 在 disaggregated LLM 服务基础上引入 SLO-aware 多路复用:Multiplexing Toggle 用 slack 检测把短 prefill 借道 decode worker 执行、长 prefill 走独占 prefill worker,兼得低排队与低干扰。在 Mooncake 真实 trace 上 SLO 内可服务请求提升 2.02×,P90 TTFT 相比 DistServe 优化 9×,P90 TPOT 相比 vLLM 优化 2.33×。
GPU kernel 优化的强化学习框架:让 Skill Selection、Policy、Skill Summary 三个 agent 共享同一 LLM backbone 端到端联合优化。选择器用 BM25+LLM 重排检索技能,策略生成多轮 CUDA/Triton,摘要器把成功 rollout 蒸馏为可复用 skill,并用执行验证过滤。SFT 冷启动+多轮 REINFORCE 联合训练。KernelBench 上 daVinci-kernel-14B 在 Fast_1 阈值下 L1/L2/L3 达 37.2%/70.6%/32.2%,8B 上 L2 Fast_1.2 从 9.4→22.1、L3 从 0.5→3.0,超越 Dr. Kernel-14B。
首个针对真实编码 Agent(Claude Code)负载的系统研究:会话闭环、上下文持续膨胀、工具触发主导;CacheWise 在 vLLM 上以约 2500 行代码扩展前缀感知调度 + 基于工具元数据的预测式 KVCache 驱逐,评测中 KV 驱逐减少 2–2.6×,session 完成时间最高降低 3.5×,token goodput 提升 1.64–2×。
针对分布式 LLM 服务中 worker 故障同时丢失 KV cache 与服务容量的问题,提出以负载感知协调决策来做故障恢复的 LUMEN。三大机制:负载感知 KV checkpointing(用 $h(r)=\arg\min_w(q_w+\lambda p_w(r))$ 把 checkpoint 分散到低负载 worker)、局部性感知恢复调度(先按 checkpoint holder 路由再按 average-based 规则重平衡)、投机辅助渐进恢复(在恢复 worker 上加载 draft model,通过 fused batch 单次前向验证辅助最拥堵的存活 worker)。SGLang 原型上,Qwen3-32B/14B 相比 Stop-and-Restart 降低 TTFT 44.4%/29.6%、recovery time 50.0%/64.1%;大规模模拟中在 64 worker、25% 故障率下仍有 46.8-51.2% TTFT 降幅。
针对异构 LLM 服务栈的两层调度割裂(router 忽略实例负载,load balancer 忽略质量)问题,将模型路由与负载均衡融合为对具体模型实例的在线赋值。对每批请求求解 quality-latency-cost 三维单纯形加权得分:batched MiniLM+KNN 一次估算 prompt 内在的 quality/output-length,per-tier XGBoost TPOT + dead-reckoning 在线估计延迟,按 LPT 顺序贪心分派。在 13 实例 28 GPU 异构集群、四种模型规模上,单套栈只调权重就能横跨 quality-cost-throughput 前沿;平衡预设在 2.8 s 端到端延迟与 30 req/s 下领先增强版 BEST-Route 2.6-4.1×,最高质量 DeepEval 0.419(+0.013 优于最强基线)。
针对第三方共享加速器基础设施上的模型外泄威胁(如 Hermes 通过被动 PCIe 观测无损重建 DNN、TunnelS 通过驱动级访问以高吞吐外泄 HBM),提出软件层内存混淆框架 CloakLM。结合 PCIe 流量整形、层间/层内权重乱序与物理 HBM 页面重映射三种机制,让授权执行保持有效虚拟内存布局且开销可忽略,而未授权观察者看到的是碎片化、语义不连贯的状态。集成于 vLLM 与 PyTorch,与机密计算互补,在 LLaMA/Qwen 分布式推理上实现接近原生的性能同时大幅提高对 PCIe 窃听与 HBM dump 攻击的抵抗力。
面向异构 spot GPU 集群的低成本 LLM 服务系统。用 roofline 模型解析式估算性能,动态规划联合优化节点配置、并行策略与层分配以最大化异构 GPU 吞吐;结合输出保持的请求迁移与共享 tensor store 并发初始化,将替换节点的准备与在服请求重叠以最小化迁移停机。在 AWS L4/A10G/L40S 异构集群上,Llama-3.1-70B 与 Qwen3-32B 相比 SOTA 基线吞吐分别提升 1.42× 与 1.35×,相比 on-demand 实例在离线/在线服务分别节省 31.9% 与 31.2% 成本。
首个面向流式视频生成服务的调度系统。将服务建模为在线调度问题,通过迁移感知的 min-max 会话再平衡与负载驱动的 GPU 自动扩缩,配合 GPU-CPU 卸载和 RDMA 会话迁移,联合优化每 chunk 最差延迟与 GPU 成本。在生数科技生产 trace 上,相比基线平均降低最坏每 chunk 延迟 37.5%(最高 51.6%)、降低 GPU 运营成本 37.2%(最高 49.0%),且与离线 oracle 相比调度成本仅差 6.1%。
FlashRT 提出 execution-state capsule:把整个 forward 用 CUDA Graph 静态缓冲区捕获,再把已提交边界处的 KV / 循环 / 卷积 / MTP / 元数据整个 buffer set 作为可 freeze/restore/fork/rollback 的显式对象。相较 vLLM 冷路径,同 hybrid LLM 单流 TTFT 从 200/365/723ms 降到 51/53/54ms,相较 vLLM APC 也快 1.4–2.8×;16k prefix 时相较自身 cold 加速 27×,restore/snapshot 亚毫秒完成,KV-only 恢复的 97.9% token 会发散,证明 hybrid recurrent 状态必须整体 snapshot。
WiSP 将低资源 MoE serving 建模为专家权重与 KV 缓存两条 working-set 争夺同一 VRAM 的问题。核心是 routing-aware expert pager(基于 expert_map 的 LRU 分页,字节等价输出)加 MV-WSA 边际价值分配器,联合分配 expert scratch 与 KV pool。iso-VRAM 下相对 vLLM static offload 解码吞吐最高提升 1.95×,Jamba-52B/MiniMax-M2-229B 等 baseline 无法启动的模型上也能可服务,且揭示单流 decode 中 routing 预测只能省显存不能省延迟。
本文提出工业级 ML 推理容量测试框架 Vanguard:基于自适应反馈搜索(dampening / spike tolerance / convergence detection)、多指标健康评估状态机、以及流量回放的负载生成器,为 GPU 上多类别模型(推荐/排序/视觉/NLP)精确估计可持续吞吐量。14 个工业模型上估计误差中位 5.2%,与实测容量 R²=0.94,单个模型 GPU 减配 49–83%。
首个交互感知(interaction-aware)的实时 Omni-LM 服务系统:把播放进度、语音活动、barge-in 事件暴露给调度与 KV 管理。调度器用 U0/U1/U2 三级紧急度优先 first-audio 与近欠载会话、限制超前播放前沿的生成;KV 管理器用 next-use 感知驱逐替代 LRU、并在用户说话时预加载可能需要的 KV 以隐藏 reload 延迟。基于 vLLM-Omni,在两个 Omni-LM 与混合负载上把 P90 音频 TTFP 平均降 1.55×(至多 2.21×),完成请求吞吐平均升 1.15×(至多 1.56×),把大部分 KV reload 移出下一轮关键路径
系统性刻画 Intel TDX + NVIDIA GPU-CC 机密计算下 CVM–GPU 桥被串行化的性能规律,并给出可迁移的运行时/加载器/KV 恢复策略;同时首次公开 B300 机密多 GPU NVSwitch 租户能力
DigenRL:为扩散生成模型 RL 后训练设计的解耦式(disaggregated)系统。用 Generation-Axis Pipeline (GAP) 沿生成维度细粒度流水,Timestep Parallelism (TSP) 替代数据并行提升 trainer GPU 利用率,Elastic Trainer-Assisted Generation (TAG) 让 trainer 空闲时协助 rollout,Trajectory-Consistent Stale Sync (TCSS) 严格约束一步陈旧样本。相比 VeRL-Omni 在 QwenImage 20B 上加速 1.56×–2.21×;HunyuanVideo 1.13×–1.49×;异构 GPU 场景 1.46×–1.85×;消融显示 GAP+TSP+TAG+TCSS 累计将 speedup 从 naive 1.52× 提升到 3.34×。
受有限元法与区域分解理论启发的强化学习加速框架:把状态空间沿列方向划分为 M 个重叠子网格,各自维护局部 Q_i;在重叠边界上通过边界一致 TD 更新耦合相邻子网格值函数(边界传播引理保证 Bellman 不动点保持)。不改奖励、不改 Bellman 算子、无显式规划,即可显著加速稀疏奖励下的价值传播。在 10×30 与 20×20 网格 50 洞环境中,M=6 让 Q-learning 累积奖励从 -175k 提升到 +454k;SARSA 从 -245k 提升到 +458k;Dyna-Q 亦获额外提升,最终奖励从 -4.3 → 47.9。
SharQ提出FP4量化与N:M稀疏协同的免训练推理方案:在线抽取outlier主导的稀疏骨干做sparse FP4 GEMM,再用dense FP4 GEMM对稀疏路径的量化+掩码误差做残差补偿,两路径共享单份FP4权重与path-specific scale视图。Llama-3.1-8B/Qwen2.5-7B/Qwen3-30B-A3B/Qwen3-VL-8B上恢复43–63%的NVFP4-FP16精度差,RTX 5090延迟对FP16降2.2–2.4×、对FP8吞吐提升1.2–1.4×,Wan2.2-T2V加SageAttention最高1.58×。
CAT-Q首次以纯PTQ路线量化LLM到1.58bit三元权重,无需QAT。两个核心模块:Learnable Modulation用可学习因子$(\delta_\mu,\delta_\alpha,\delta_\Delta)$调制预训练权重分布与三元阈值,Softened Ternarization用tanh-based smooth transition函数从identity渐变到hard ternarization。仅512校准样本、8卡A100 8–60小时即可把1.7B–235B模型三元化,性能超越用100B tokens训练的BitNet 1.58-bit v1/v2,训练token量减少约10^5倍。
面向 Qwen-Image-2.0 扩散模型的 RLHF + On-Policy Distillation 后训练管线。用 VLM 微调 + 逐点评分 + CoT 构建 T2I(对齐/美学/人像)与编辑(指令遵循/人脸ID)复合奖励;基于 Flow-GRPO 引入混合 CFG(仅 rollout 用 CFG)、组内奖励范围过滤、每类权重校准、高噪声时间步采样;最后用 OPD 通过轨迹级速度匹配(W2 上界)把 T2I 与编辑双教师合并为单学生。Qwen-Image-Bench 57.84(+2.61),T2I Elo 1193(+78),编辑 Elo 1349(+93)。
面向ICME 2026 W4A4量化挑战赛的Wan2.2-I2V-A14B视频扩散模型4bit权重/4bit激活推理方案。将LLM量化领域的SmoothQuant逐通道平滑与MixQ稀疏离群列拆分迁移到视频扩散FFN,并叠加块级HiF4权重打包与双分支GEMM。在VBench I2V上各项指标相对FP16降幅控制在2–3.5%,运动平滑度反而提升+0.4%,全面优于原生HiFloat4基线(后者跌约5%)。
A compiler technique that automatically fixes FX graph breaks in PyTorch 2 programs through AST-level program analysis and transformations
PyTorch 2 introduces TorchDynamo and TorchInductor for JIT graph compilation in PyTorch while retaining eager mode flexibility
Transformer 架构的开创性工作 - 纯注意力机制的序列转导模型
在固定 KV-cache 显存预算下研究异构 prefill/decode 长度的离线 LLM 服务调度:证明问题 NP-hard、FCFS/最短输出优先/总长度优先均有无界近似比;提出 Sorted-F 算法——用 F-metric(平均输出长度 / 批大小)平衡批并发与下游解码成本,证明常数因子近似比 ≤48;配三种 Phase-1 求解器(精确 DP、局部交换、分位贪心)与 LP 引导 / receding-horizon 变体。真实混合负载上相对 FCFS 提速 4.87×、相对 MC-SF 提速 2.09×,与 LP 下界差距仅 1.03-1.09×
面向 prefill-decode 分离式 LLM 服务的 GPU 友好、无损 KV cache 传输压缩器。核心洞见:BF16 KV 激活的冗余集中在指数字段(指数熵仅 2.89-3.59 bit,而 BF16 指数占 8 bit),Top-16 高频指数即覆盖 ≥99.3%。SplitZip 用定长 4-bit 码编码高频指数(两码打包一字节),罕见指数走稀疏 escape 流(位置+原值),符号-尾数原样保留——比特级无损。离线校准 Top-16 码本消除在线直方图;规整稠密路径 + 稀疏 escape 修正使编解码在 GPU 上无分支高效。真实 BF16 激活上达 613.3 GB/s 压缩、2181.8 GB/s 解压(超越所有已测无损压缩器);端到端 BF16 KV 传输加速 1.32×、TTFT 1.30×、请求吞吐 1.23×;同法扩展 FP8 在 E5M2 上再压 1.14×
块级粒度的灵活上下文并行范式,通过任意点对点通信 + bin-packing 调度,在 256 张 NVIDIA GPU 上实现近线性扩展,attention MFU 提升 1.13x–2.21x
首个面向解耦式 LLM 服务的服务感知自适应 KV 缓存压缩框架,通过统一压缩策略空间 + 贝叶斯剖析引擎 + 服务感知在线控制器,PD 分离场景 JCT 加速最高 9.13x,KV 解耦场景 TTFT 降低最高 32.8x
面向 chunked prefill 的稀疏注意力机制,将 2D 块稀疏掩码视为「KV 选择信号」而非「稀疏内核执行计划」,通过 Q-block union + intra-group union 构造 GQA 感知的 per-group KV 块表,实现零拷贝分页注意力执行,在 LLaMA-3.1-8B 上 128K 上下文取得 2.72x 注意力加速且精度接近 dense
用可微、自适应稀疏的 α-entmax 变换替代分层稀疏注意力中的 top-k 路由,让第一阶段按 query 自适应选择可变数量的 KV 块并为第二阶段 softmax 提供 prior,使整个层级端到端可微且非弥散(non-dispersive)。75% 稀疏度下精度媲美 full attention,Pareto 前沿优于 NSA/InfLLMv2,推理较 FlashAttention-3 最高 3.36x 加速
提出 SIA 自改进循环——由 Feedback-Agent 同时更新任务专属 agent 的「harness(脚手架)」与「模型权重(LoRA)」,打破自改进 AI 的两大孤岛(仅改 scaffold / 仅改 weights)。在中文法律分类、GPU kernel 优化、单细胞 RNA 去噪三个对比领域上,双杠杆组合全面超越单独 scaffold 迭代:LawBench +25.1%、GPU kernel 快 12.4%、去噪 +20.4%(均超先前 SOTA)
将位置无关 KV 复用(PIC)的恢复粒度从「token 级」提升到「注意力头级」——离线将每个 (layer, head) 分类为 global(12-15%,复用时重算)/ local(85-88%,滑窗内原样复用),配合 token 选择性稀疏 FFN 攻克短上下文 FFN 瓶颈;再以 SegPagedAttention 按 (layer, head) 分页物化头级稀疏、走 FlashAttention 快路避开 attn_mask 4.9-7.6× 惩罚。8×H800 上 TTFT 加速 1.6-3.54×(DeepSeek-V4 达 5.16×)、并发会话 4.7-7.8×、prefill FLOPs 降 67-79.5%,精度媲美稠密
首个在运行时于专家并行(EP)与张量并行(TP)间无缝切换、不重启引擎、不丢弃在途请求的 MoE 服务系统。核心洞见:EP 与 TP 是同一模型的两种布局而非两个模型,切换只改变「哪个 rank 拥有哪一片」,唯一成本是搬运换主字节,NVLink 使其在两次 decode step 间完成。用统一内存管理器保持 CUDA graph 跨切换有效、融合直传 kernel、双控制平面同时驻留。8×H200 服务 Qwen3-235B-A22B,RL rollout 超越 1.16-1.25×,每次切换 215-434ms,仅 2.4% 显存开销
首个面向扩散语言模型(DLM)的集群级服务系统。DLM 每步并行解掩多个 token,比自回归模型吞吐高 1.75×,但引入置信度阈值这一「速度-质量」旋钮与 TP 度「时延-吞吐」权衡。DiLaServe 以「去噪步」为调度粒度,用 SLO 感知阈值调整 + 自适应负载控制动态选阈、轻量梯度提升 Step Predictor 在线预测剩余步数、按最低步时延调度并支持步级迁移、两阶段 ILP 定期重构集群 TP 配置,并把近似 KV 缓存的 cache/recompute 步异构成本纳入调度。基于 vLLM+Ray 实现(9500 行),真实 trace 上 SLO 达成率 +30.2pp、时延 -46%、质量仅降 0.09;多基准最高 +56.6pp SLO、精度仅降 0.9%
Mimose - 输入感知型张量检查点规划器,用于GPU高效训练
一种面向托管语言运行时(如JVM)的对象级CXL内存管理系统,通过profile-guided对象热度追踪与对象压缩技术解决页内热度倾斜问题
PRR 推理运行时,通过 EMA 预测器+增量修复内核将动态稀疏注意力的选择-注意力依赖瓶颈降低 30%+
Prism 通过 GPU 内存气球技术实现多 LLM 共享服务,统一时间共享和空间共享,SLO 达标率下支持 2.3-3.5x 更多请求,已在 10K+ GPU 生产环境部署
xLLM 是面向企业级大规模服务的 LLM 推理框架,采用解耦服务-引擎架构,通过动态 PD 分离、EPD 分离和多层流水线优化,吞吐量达到 MindIE 的 1.7x 和 vLLM-Ascend 的 2.2x
STCA 将历史自注意力替换为目标-历史交叉注意力,复杂度从 O(L²) 降至 O(L),RLB 在请求级复用用户编码,实现 10K 长序列端到端训练,已部署于抖音全量流量
DSpark 结合半自回归生成和置信度调度验证,统一高吞吐并行生成与自适应负载感知验证,在 DeepSeek-V4 生产系统中实现 60%-85% 生成加速
TIGER 框架将推荐重新定义为生成式检索任务,使用 RQ-VAE 生成 Semantic ID,Transformer 自回归解码预测下一个物品,在多个数据集上超越 SOTA
在 YouTube 排序模型中验证 Semantic ID 替代随机视频 ID,通过 RQ-VAE 量化内容嵌入为离散语义 token,提升冷启动和长尾物品的泛化能力
Generative Recommenders (GR) 将推荐重新定义为序列转导任务,HSTU 编码器比 FlashAttention2 Transformer 快 5.3x-15.2x,1.5 万亿参数模型在线 A/B 测试提升 12.4%
统一多模态理解与生成模型综述:系统梳理三大架构范式(扩散/自回归/混合),数据集与基准测试
UG-Sep 在 TokenMixer 架构中解耦用户侧和物品侧信息流,实现用户侧计算复用,推理延迟降低 20%,已部署于字节跳动多个业务场景
统一多模态基础模型,融合空间增强 MLLM 与 MMDiT,实现理解/生成/编辑一体化,支持空间推理
可学习进化记忆的实时无限视频生成框架,首次实现 24 小时(>130万帧)实时视频生成
首个全面评估 LLM 效率技术的大规模基准测试,涵盖架构预训练、微调和量化推理
基于哈密顿分解的电路交换网络架构,支持超大规模 LLM 训练的灵活、可扩展、低成本互连
JetBrains 开源 12B MoE 代码大模型,2.5B 激活参数,128K 上下文,支持代码生成/推理/工具调用
MoE语言模型的效率杠杆缩放定律,通过300+模型训练验证高效MoE架构设计原则
通过Reference Sliding Window Attention实现恒定KV缓存,支持单次前向传播解析数十页文档
分布式基础设施上大规模语言模型高效训练的全面综述,涵盖基础设施、并行策略、计算通信优化与系统可靠性
分布式 LLM 训练系统与基础设施的深度技术分析
通过解耦动量更新和结构化稀疏化,将分布式训练通信量降低高达85倍
分布式训练通信压缩优化器的深度技术分析
Compiler Framework to Maximize CUDA Graph Coverage and Benefits
Source-Level Compiler Technique to Eliminate FX Graph Breaks
Hybrid Expert/Data Transmission for MoE Training
Transformer 推理全栈优化综述,涵盖硬件设计、软件优化、调度策略和神经架构搜索
通过旋转特征实现连续分布式对象中心表示,将对象发现从简单玩具数据扩展到真实世界数据
通过 PagedAttention 算法实现高效 KV cache 内存管理,构建 vLLM 高吞吐量 LLM 服务系统
提出 Virtual Token Counter (VTC) 公平调度算法,实现 LLM 推理服务的 token 粒度公平共享,证明 2x 紧上界
对 Nvidia Hopper GPU 架构进行全面基准测试,揭示 Tensor Core、DPX、分布式共享内存等新特性的性能特征
面向 Kimi 的 KVCache 中心化解耦架构,通过分离 Prefill 和 Decode 集群实现 525% 吞吐量提升
MoE 在大语言模型中的全面综述,涵盖门控函数、专家网络、训练推理方案、系统设计和应用
FlowKV 提出低成本低延迟的 KV Cache 传输方案和负载感知调度器,实现分离式 LLM 推理框架的 96% 传输延迟降低
CXL-Enabled KV-Cache Management Beyond GPU Limits
提出基于 CXL 共享内存的机架级 KV Cache 系统 TraCT,消除 RDMA 网络跳数,实现 GPU-CXL 直接 DMA 传输,TTFT 降低 9.8x,吞吐量提升 1.6x
End-to-End VLA with Differentiable Latent Intent Bottleneck
提出 CPU-GPU 混合注意力框架 HybridGen,通过注意力 logit 并行化、反馈调度器和语义感知 KV Cache 映射,实现长上下文 LLM 推理的高效协同计算
通过架构感知大小调整、六层内存层次和贝叶斯重用预测,实现 KV Cache 的预测性多层内存管理
最强开源终端代理 RL 训练方案,通过 TMAX-15K 数据集和 DPPO 训练实现 Terminal-Bench 2.0 上 27% 的最优性能
无需训练的视频扩散模型加速策略,通过动态特征复用和 CFG-Cache 实现 1.67x 加速同时保持高质量生成
面向现代 LLM 推理服务的离散事件模拟器,支持解耦架构、运行时优化和有状态工作负载,吞吐量误差低于 4%
LLM 生成式推荐综述,探讨如何将推荐系统从多阶段判别式流程转变为单阶段生成式流程
通过将 MoE 架构重构为多个独立的专家集群,消除 all-to-all 通信瓶颈,实现高效的分布式推理
通过复用闲置尾部模型服务作为远程草稿模型,实现资源高效的 LLM 推理服务
通过阶段式协调推理架构,实现流式 VideoLLM 在单 A100 GPU 上达到 134 FPS 吞吐量和低于 50ms TTFT
针对万卡 GPU 集群的低开销、细粒度、常开追踪与实时分析系统,总开销 <2%,内核事件压缩 3,700x
引入注意力机制的神经机器翻译,突破固定长度向量瓶颈
硬件感知的TB级CTR模型训练框架,通过k步模型合并和拓扑感知通信优化实现4倍加速
编译器驱动的注意力编程模型,用几行PyTorch代码实现优化的注意力内核
基于Tile-Centric原语的编译器框架,高效生成计算-通信重叠内核
从生产实践角度重新审视KV缓存压缩技术,揭示吞吐量、响应长度和负样本三个被忽视的关键维度
开源30B MoE多模态基础模型,仅3B激活参数,支持256K超长视频理解
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
去噪扩散概率模型
使用稀疏 MoE 扩展扩散 Transformer 到 16.5B 参数
使用自适应专家选择路由扩展扩散 Transformer
高效视频目标分割与跟踪模型
基于时间步嵌入感知的缓存策略加速视频扩散模型推理
改进极低比特 LLM 量化的缩放定律
滑动瓦片注意力加速视频扩散 Transformer 推理
高效扩散模型综述:算法级、系统级和框架视角
利用稀疏注意力模式加速视频扩散 Transformer 推理
自适应混合缓存策略加速视频扩散模型推理
具有扩散噪声搜索的强度可控时间一致说话头生成
面向 SLO 的微秒级 GPU 抢占调度系统
面向多智能体 LLM 系统的稳定强化学习
具有空间理解和在线强化学习的视觉-语言-动作模型
面向 LLM 多智能体系统的通用 RL 优化框架
面向 Agentic RL 的灵活 Swarm 训练框架
通过解耦基础设施实现 Agentic RL 训练的规模化扩展
利用异步性和低精度实现快速准确的注意力机制
通过潜在轨迹引导实现运动可控的视频生成
基于可学习 token 稀疏化的 DiT 加速框架
基于 PCA 旋转的 DiT 4-bit 后训练量化框架
波形流水线并行策略,提升大模型训练效率
RTPurbo: 将全注意力 LLM 转化为稀疏模型,仅需数百步训练
从权重稀疏到激活稀疏:DiT 模型的 N:M 半结构化稀疏加速
通过多 token 预测训练提升 LLM 性能和推理速度
基于 MLLM 语义规划和 DiT 渲染的统一视频生成与编辑框架
使用模型并行训练数十亿参数语言模型
神经语言模型的缩放定律:模型大小、数据集大小和计算量与损失之间的幂律关系
发现MoE大语言模型中的超级专家:少量关键专家对模型性能的决定性影响
消除 Hopper GPU 上低精度训练和推理的填充需求
阿里巴巴Qwen团队的统一多模态模型,在文本、图像、音频、视频上无性能退化
无训练方法解决自回归视频扩散模型的长视频生成退化问题
开源可控文本到语音系统,支持多说话人、多轮对话和自然语言指令控制
微软AI从零构建的35B/1T MoE推理模型,AIME 2025达97%,SWE-Bench Pro达52.8%
通过差分缩放和动态间隔缓存实现 DiT 的极端加速
端到端序列到序列学习的开创性工作
基于机器学习的 NVIDIA Ada Lovelace GEMM 性能和能耗分析
FP8 量化对数据中心 LLM 推理 TCO 的影响分析
在华为 Ascend NPU 上使用 FP16 单元模拟 FP32 GEMM 的精度恢复方法
基于异步引用的现代 GPU 自动 Warp 特化编译器
NVIDIA B200 GPU 微基准测试与架构深度分析
面向细粒度和稀疏 MoE 的 IO 和 Tile 感知优化加速器
面向最优每 FLOP 和每参数精度的 MoE 架构设计
AMD MI300A 上 FP8 矩阵核心、异步执行和结构化稀疏的执行特征分析
Qwen 图像生成基础模型技术报告
实时交互式长视频生成框架
实时自回归长视频扩散生成技术
实时交互式运动控制视频生成
实时直播视频生成的流式系统
NVFP4 量化精度提升的自适应块缩放方法
面向高质量实时交互式视频生成的自回归扩散蒸馏正确方法
通过对比策略优化对齐自回归视频生成
通过跨模态上下文学习改进联合音视频生成
面向快速视频生成的自洽分布匹配与缓存感知训练框架
分解大语言模型的高效并行推理系统
面向少步自回归世界模型推理的跨分块缓存加速
NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真
通过知识蒸馏和模态自适应剪枝压缩视觉语言模型
基于非结构化稀疏性的高效大语言模型推理加速框架,通过 Load-as-Sparse and Compute-as-Dense 方法在 Tensor Core 上实现高效 SpMM
一种将全局剪枝分解为可管理子问题的LLM压缩框架
首个免训练、即插即用的VLA推理加速框架,通过动作复用和视觉token剪枝实现55.7% FLOPs降低和36.0%延迟降低
一种无需训练的结构化推理加速框架,用于加速扩散式视觉-语言-动作模型
LLM 智能体强化学习综述:从被动序列生成器到自主决策智能体
A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
一种通过组感知上下文学习加速同步 LLM 强化学习 Rollout 的系统
通过组合权重稀疏性和数据稀疏性提升 MoE 计算效率
通过稀疏性诱导提升 LLM 后训练剪枝精度
ServiceNow Research 开源的大语言模型分布式训练库,基于 PyTorch 和 Triton 构建,支持 3D 并行、ZeRO、MoE 等特性
NVIDIA Jetson平台优化的本地大语言模型推理框架,支持量化、多模态、语音、向量数据库和RAG
SparseVLM 和 SparseVLM+ 的完整技术分析,涵盖文本引导的视觉Token稀疏化方法、注意力重力校正、优先头选择等核心创新
通过低秩Key缓存和CPU卸载Value缓存实现高吞吐量长上下文LLM推理
通用多模态理解与推理视觉语言基础模型,532M视觉编码器 + 20B活跃参数MoE LLM
模型驱动的代码预训练数据构建方法,最小化人工干预
通过尾部批处理和全栈系统优化解决RL训练中长尾rollout导致的GPU利用率低问题
基于扩散的代码大语言模型,通过Block Diffusion持续预训练超越自回归基线
高保真仿真就绪3D内容生成系统,支持场景布局、部件分解和铰接生成
覆盖并行策略、序列并行、MoE并行、内存优化、通信优化、容错与系统框架
覆盖分布式RL、RLHF系统、环境加速、采样优化、通信优化、内存优化等方向
从硬件约束出发,推导RL训练的最优并行策略、资源分配和流水线设计
大规模MoE模型的高效推理框架,实现26倍吞吐量提升和4-bit量化
通过平滑激活离群值实现LLM的W8A8量化,支持高达530B参数模型的无损量化
基于查找表的超低精度CNN推理加速方法,2-bit实现比QNNPACK INT8快1.74倍
发现Attention Sink现象,提出StreamingLLM框架实现无限长度流式推理
面向资源受限环境的MoE模型高效推理系统,通过智能CPU-GPU协作实现最优执行策略
W4A8量化方法,通过自适应平滑和Hessian补偿实现高质量4-bit权重量化,同时加速预填充和解码
通过区分检索头和流式头,同时优化长上下文LLM推理的内存和计算效率
硬件高效的W4A8 GEMM内核,实现2.90倍加速和4.94倍系统级加速
8B参数高效多模态大语言模型,通过统一3D-Resampler、文档知识统一学习范式和混合强化学习实现性能与效率的平衡
基于微缩放和自动缩放的高效FP8 LLM训练方法,实现34%吞吐量提升
基于softmax阈值的动态块稀疏注意力,无需训练和预计算,同时加速预填充和解码阶段
统一FP8精度流的强化学习训练框架,实现16%端到端加速
多模型LLM调度的实证研究,分析CPU-GPU卸载和抢占的性能影响,为下一代调度系统提供设计指导
通过流水线并行实现高准确率零气泡推测解码,突破传统多token预测的结构限制
通过知识蒸馏实现高效视频帧选择的查询无关方法,在低帧预算下显著优于现有方法
通过重要性基�的固定容量循环状态实现视频VLM的线性时间预填充,在长视频理解中接近全自注意力性能
一种低比特量化方法,通过混合精度、细粒度分组量化和动态量化实现高效LLM推理
NVIDIA全模态世界模型,统一语言、图像、视频、音频和动作的理解与生成,为Physical AI提供通用骨干网络
系统梳理Sparse Attention在LLM推理中的技术演进、核心方法与工程实践
首个Vision Transformer算法-加速器协同设计框架,通过固定稀疏注意力模式和自编码器实现高效加速
免训练扩散模型加速框架,利用U-Net高层特征的时间冗余实现缓存复用
面向扩散Transformer的层缓存加速方法,通过可微分路由器学习最优缓存策略
通用分布式加速框架,通过异步去噪实现扩散模型的多设备并行推理
从 Llama 3-8B 高效上循环训练 MoE 模型
分离prefill和decoding阶段的KV缓存压缩框架,解决长文本生成中的heavy hitter偏移问题
基于KV缓存管理的LLM加速综述,系统梳理Token级、模型级和系统级三层优化策略
基于分块软匹配的在线KV缓存聚类框架,实现80%内存节省和3.19倍解码加速
面向单个消费级GPU的高效长上下文LLM推理系统,通过自适应分层KV管理实现3.46倍加速
梯形KV缓存模式,实现长上下文LLM推理的高效内存管理与连续生成
PostDiff:免训练扩散模型压缩框架,通过混合分辨率去噪和混合模块缓存降低单步推理成本
解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析
首个面向企业级LLM推理的开源高效KV缓存层,支持跨查询复用和PD分离架构
面向延迟最优的混合小语言模型,通过深度-宽度优化、算子搜索和权重归一化实现SOTA效率
面向多轮LLM Agent RL训练的可扩展基础设施,通过Rollout-as-a-Service解耦训练与推理
全栈开源框架,将T2V/TI2V基础模型转换为相机可控的少步自回归视频世界模型
系统感知的KV缓存优化综述,从时间、空间、结构三个维度系统梳理LLM推理中的KV缓存管理技术
通过块级并行计算实现长序列Transformer训练,支持32倍更长上下文
基于3D并行的大规模Early-Exit LLM训练与推理框架
通过专家卸载和动态放置实现MoE模型训练的高效扩展,支持67倍专家扩展和17.5倍吞吐量提升
本文深入分析MegaScale-MoE,一个专为大规模MoE模型高效训练设计的生产系统,通过通信高效并行策略、通信-计算重叠和通信压缩,在1,440个NVIDIA Hopper GPU上训练352B MoE模型实现1.41M tokens/s吞吐量,相比Megatron-LM提升1.88倍。
首个完全融合的分布式MoE算子,将专家计算和GPU间通信融合为单一持久化GPU内核
面向长上下文LLM服务的分层上下文缓存框架
本文提出EaaS,一种将MoE模块解耦为独立无状态服务的新型服务系统,实现细粒度资源扩展和固有容错能力,在模拟硬件故障下吞吐量下降不超过2%,并可节省高达37.5%的计算资源。
阿里巴巴高性能LLM推理引擎,服务超1亿用户的大规模部署
面向LLM多智能体工作流的高效前缀缓存管理框架,通过Agent Step Graph和工作流感知驱逐策略实现最高2.19倍加速
全方向校准的LLM量化技术,通过LWC和LET实现PTQ效率与QAT性能的统一
稀疏驱动的数据同步系统,实现分布式训练5.09×通信加速
面向GPU的3D稀疏卷积加速引擎
面向推理最优的MoE大语言模型扩展律研究
通过设备内并行实现最优LLM服务吞吐量
针对MoE模型的专家流水线调度器,通过计算通信重叠实现推理吞吐量提升
基于CPU-GPU-I/O流水线调度的高吞吐量MoE推理系统
基于查询感知模型扩展的文本到图像扩散模型高效服务系统
首个将FlashAttention与量化算法结合的注意力加速方案,实现1.8倍延迟加速和2.37倍吞吐量提升
FlashInfer:面向LLM推理服务的高效可定制注意力引擎,通过块稀疏格式、JIT编译和负载均衡调度实现高性能注意力计算
利用时空稀疏性加速视频扩散Transformer推理,实现2.28×/2.33×端到端加速
通过细粒度专家卸载优化MoE大模型服务的延迟-内存权衡
通过灵活高效的卸载打破内存约束实现设备端LLM推理
通过动态模型重分片实现高吞吐量LLM推理
基于模块级批处理的单GPU高吞吐量MoE推理系统
通过反斜线评分实现高效块稀疏注意力,加速长上下文推理高达13.5倍
细粒度MoE模型推理优化分析,探索专家跳过和专家剪枝的效率与性能权衡
使用What-if分析理解大模型训练中的Straggler问题
面向内存受限GPU的即时MoE推理系统,通过混合压缩和稀疏预测实现48.7×加速
针对MoE模型的高效All-to-All通信调度器,通过两阶段调度解决负载倾斜和incast问题
面向现代AI工作负载的编译器中心GPU内核性能分析基础设施
面向推理模型的冗余感知KV缓存压缩
自适应向量搜索索引系统,在动态工作负载下实现1.5-38×延迟降低
自强制训练范式解决自回归视频扩散模型的暴露偏差问题,实现单GPU 17FPS实时视频生成
基于树结构自适应神经老虎机路由器的在线MoE推理优化,实现45%延迟降低和25%内存节省
通过随机共激活采样和层次化路由器损失,实现MoE模型推理时弹性扩展,有效扩展范围达训练时k的2-3倍
通过聚合异构互连(NVLink、PCIe、RDMA NIC)提升节点内集合通信带宽
面向生成式推荐的高效推理系统,通过xAttention/xBeam/xSchedule三层优化实现3.49倍吞吐量提升
软件定义的多路径内存访问系统,打破LLM服务中的主机-GPU带宽瓶颈
面向解耦专家并行的细粒度任务调度框架,实现MoE推理吞吐量提升1.61×
面向MoE模型的弹性推理框架,将故障影响限制在单个worker级别,实现160-213×的停顿减少
面向扩散Transformer分布式推理的可扩展序列并行引擎
利用软激活稀疏性和低秩分解的LLM压缩方法
通过自辅助推测解码实现高效MoE推理,最高4.30×吞吐量提升
动态模块级专家剪枝框架,实现LoRA-MoE微调参数减少43%且精度不降
统一的具身基础模型,通过DiT动作解码器将视觉-语言建模扩展到连续动作生成
通过O(1)主机缓存实现快速、实时的大模型自动扩展
通过级联规划器(EAM+EAP)实现高效专家预取,在资源受限设备上加速MoE推理,吞吐量提升65.13%
通过量化填充、专家内存池和层感知调度实现无回退的高效MoE推理,相比MoE-Infinity加速2.86倍
解耦敏感度与重要性:面向推理的KV缓存压缩框架
通过退出感知结构化dropout增强早期退出Vision Transformer性能
面向多模态大模型的EPD阶段解耦推理系统,在昇腾NPU上实现57-69%吞吐量提升
优化树结构LLM推理的注意力内核和运行时
利用CPU计算实现灵活的LLM推理
软件定义的流水线编译器,实现异构硬件单元的高效计算流水线
面向高分辨率长视频生成的时空扩散Transformer可扩展推理
串行性能优化的系统方法论,包含三个原则和八种方法
面向CXL Pod的分布式内存数据库,使用CXL内存原子操作同步跨主机并发访问
面向多样化XPU的抢占式调度框架
面向自动张量化程序优化的编译器抽象,通过Block抽象实现硬件张量计算原语的自动利用
基于最大流的异构GPU集群LLM推理服务系统
A lightweight bridging paradigm that enables SOTA-level VLA performance with only 0.5B parameters, without robotic data pre-training
首个在公平比较下超越全注意力的混合线性注意力架构,通过KDA实现75% KV缓存减少和6倍解码吞吐量提升
NVIDIA Cosmos世界基础模型2.5代:面向Physical AI的视频世界仿真
面向VLA训练的灵活异步强化学习框架
小米机器人团队发布的先进VLA模型,通过精心设计的训练方案和部署策略实现高性能实时执行
KV-Cache-centric memory management system for efficient embodied planning with static-dynamic memory construction, multi-hop recomputation, and layer-balanced loading
世界动作模型是否需要测试时未来想象?
MegaTrain:在单GPU上全精度训练100B+参数大语言模型
腾讯混元多模态3D世界模型:统一生成与重建
面向大语言模型训练的工作负载均衡4D并行
面向设备端LLM的动态分层稀疏注意力长上下文建模
MineDraft:批量并行推测解码框架
DVM:基于字节码虚拟机的动态张量计算方法
突破十亿参数通用机器学习原子间势函数的训练壁垒
通过非对称深度哈希加速长上下文LLM推理
利用历史先验的生成式压缩模型实现高达10000倍地球观测数据压缩
Polar:在任意Agent Harness上规模化进行Agentic RL训练
MiniMax-M2系列:小型激活释放最大真实世界智能
Poolside Laguna M1-XS2:103B参数开放权重前沿编码Agent
GPU上稀疏矩阵乘法的设计原则
PyTorch 全分片数据并行的规模化经验
通过更好的并行性和工作分配实现更快的注意力
支持超长序列 Transformer 模型训练的系统优化
用于近无限上下文的环形注意力与分块 Transformer
通过推测流水线执行实现高效解码
FP8 大语言模型训练
针对因果 Transformer 的更快 Ring Attention 算法
高效生成式大语言模型服务综述:从算法到系统
面向KV缓存的免调优非对称量化
高效的KV缓存压缩框架,实现近无损生成推理
面向百万级LLM推理的空间压缩KV缓存
高效扩展大语言模型上下文长度的训练方案
通过内核融合实现 GPU 上快速软件通信重叠
通过动态稀疏注意力加速长上下文LLM预填充
基于GPU虚拟内存管理的高效LLM推理张量结构
面向GPU集群长上下文注意力的拓扑感知解码
面向大语言模型的混合精度自回归并行推理
灵活高效的 RLHF 分布式训练框架
通过压缩优化器状态和激活实现高效FP8训练
BFloat16精度下RoPE在长上下文训练中的问题与AnchorAttention解决方案
HashAttention:语义稀疏性实现更快推理
DeepSeek-V3: 671B 参数 MoE 语言模型技术报告
支持100万token上下文长度的Qwen2.5模型
KVTuner:敏感度感知的层级混合精度 KV 缓存量化
硬件对齐且可原生训练的稀疏注意力机制
将MoE原理应用于注意力机制的长上下文LLM
ByteScale:在超过 12,000 GPU 上高效扩展 2048K 上下文 LLM 训练
从 128K 到 4M:高效训练超长上下文大语言模型
基于稀疏注意力的长上下文泛化
面向高效 LLM 后训练的异步流式 RL 框架
长上下文注意力基准测试:从内核效率到分布式上下文并行
通过核心注意力分解实现高效长上下文语言模型训练
受 LLM 启发的序列优先点击率预测建模范式
面向网络密集型LLM推理的服务效率优化
通过自蒸馏提升多token预测的接受率和推理效率
通过集体KV缓存共享扩展多智能体LLM服务
LLM推理中KV缓存管理策略的比较表征
基于语义聚类的高效KV缓存管理
面向全模态后训练的异步强化学习引擎
面向异步GPU架构的稀疏矩阵乘法加速
使SSD支持的KV缓存在长上下文LLM服务中实用化
通用长上下文预填充加速框架,支持混合架构和连续批处理
端到端学习头部预算和token选择的LLM KV缓存驱逐
重新定义长上下文LLM推理中的KV缓存驱逐问题
基于全局保留门的KV缓存驱逐方法,可改善长上下文推理性能
面向大规模 LLM 训练和推理的统一细粒度模拟器
面向 2-bit KV 缓存量化的离线谱协方差感知旋转方法
轻量级原生统一多模态模型,通过双流MoE架构和多任务协同训练实现图像视频理解、生成与编辑
开源 SAE 套件,覆盖 Qwen3/3.5 系列 7 个模型变体的 14 组 SAE。展示 SAE 特征超越事后分析,成为模型开发实用接口:推理时引导、评估分析、数据工作流、后训练优化四大方向。
阿里巴巴 Qwen 团队提出的统一图像生成与编辑基础模型,支持 1K token 指令输入,原生 2K 分辨率,多语言文本渲染。
Qwen-Image-2.0 全能图像生成基础模型,支持文本到图像生成和图像编辑。
Mixture-of-Experts (MoE) 已被 DeepSeek、GPT、Llama、Qwen 等主流大模型采用,以降低计算开销。然而,MoE 中的 Expert Parallelism (EP) 需要频繁的 GPU 间通信(Dispatch 和 Combine),这成为性能瓶颈——通...
Agentic RL 正在重塑 LLM 后训练,但端到端训练时间被计算密集的多轮 rollout 主导,占总时间的 70% 以上。关键挑战:
首个在低延迟推理场景下为张量并行LLM推理实现高效计算通信重叠的系统,通过融合AllReduce-RMSNorm核和波感知智能分割达成最高1.28×加速
GLM-5 模型技术报告,探索从 Vibe Coding 到 Agentic Engineering 的演进。
前沿语言模型的 RL 后训练越来越多地被自回归 rollout 生成所瓶颈,使得 rollout 加速成为核心系统挑战。
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
现代大规模语言模型预训练严重依赖单程序多数据(SPMD)范式,需要在加速器之间进行紧密耦合。由于这种耦合,瞬时减速、硬件故障和同步开销会阻塞整个计算,在大规模训练时浪费大量计算时间。
Matrix-3D 提出从单张图像生成全方位可探索 3D 世界的统一框架。
NSA 提出原生可训练稀疏注意力机制,实现高效长上下文推理。
现代 GPU 工作负载,特别是大语言模型(LLM)推理,受到内核启动开销和粗粒度同步的限制,阻碍了内核间并行性。
VSA 提出可训练稀疏注意力机制,加速视频扩散模型推理。
MoE 模型推理优化技术综述,分析问题与挑战,总结最新研究进展。
UniPrefill 提出通用的长上下文 Prefill 加速框架。
Routing-Free MoE 提出无需路由的混合专家模型架构。
USP 提出统一序列并行方法,用于长上下文生成式 AI 模型。
大语言模型长上下文推理优化技术综述,涵盖 KV Cache 压缩、注意力优化等。
OdysseyLLM 提出可部署的大语言模型量化加速方案。
TriForce 提出层次化推测解码方法,实现长序列生成的无损加速。
低比特大语言模型综述:基础、系统和算法。
首个系统性跨厂商 GPU ISA 分析,识别出 10 个硬件不变计算原语,提出厂商中立的 GPU ISA 抽象执行模型
大语言模型(LLM)的自回归推理存在高延迟问题。投机解码(Speculative Decoding)通过使用轻量级草稿模型提出多个token进行批量验证来缓解这一瓶颈。然而,投机解码的采用受到以下限制:
OmniQuant 提出全方位校准的大语言模型量化方法。
FlashAttention 常用接口介绍,包括基本使用方法和性能优化技巧。
GMLake 提出高效透明的 GPU 内存碎片整理方法,提升大模型训练效率。
现有的 agentic RL 系统都采用离线批处理模式——数据收集和训练分为独立阶段,使用固定数据集。然而,每次 agent 交互都会产生一个 next-state signal(用户回复、工具输出、终端/GUI 状态变化),这些信号实时蕴含了丰富的训练信息,但没有任何现有系统将其作为在线学习...
NVIDIA提出基于Megatron Core的可扩展MoE模型训练方法,支持大规模混合专家模型的高效分布式训练。
自回归解码因其顺序性而受到瓶颈限制。投机解码(Speculative Decoding, SD)已成为加速推理的标准方法,通过使用快速草稿模型预测慢速目标模型即将生成的 token,然后通过一次目标模型前向传播并行验证。
FCP:面向异构长上下文数据的自适应上下文并行策略,支持非2幂并行度、毫秒级调度开销,训练吞吐提升1.46倍
分布式 RL 后训练大语言模型面临两个通信瓶颈:
DeepSeek提出的Engram模块,将条件记忆作为与MoE条件计算互补的新稀疏轴,通过O(1) N-gram查找实现静态知识检索,揭示U型缩放定律
基于扩散的大型语言模型(dLLMs)是一种有前景的范式,利用同时去噪实现全局规划和迭代细化。虽然这些能力对于长上下文生成特别有利,但部署此类模型面临来自严重系统低效的内存容量障碍。
基于稀疏混合专家的自适应计算实时目标检测框架,通过动态路由实现按场景复杂度分配计算资源。
ProCache提出约束感知的特征缓存与选择性计算方法,加速扩散Transformer模型的推理过程。
首个基于掩码生成Transformer的图像编辑框架,通过注意力注入和区域保持采样实现6倍加速编辑
强化学习 (RL) 已成为提升大语言模型 (LLM) 推理能力的事实范式。然而,构建一个高效、可扩展、可抢占的 RL 训练框架面临四大挑战:
支持时空定位、时序检索和视频问答的大规模多模态模型,通过统一编码架构实现视频理解与创作
LLM 服务越来越多地被 decode attention 主导,这是一个 memory-bound 操作,因为需要从全局内存加载大量的 KV cache。
通过强化学习增强视觉-语言-动作框架,实现四足机器人的显式推理和连续控制
OmniSparse提出训练感知的细粒度稀疏注意力机制,优化长视频多模态大语言模型的推理效率。
首个多视频理解评估基准,评估MLLM在跨视频感知和推理方面的8项核心能力
首个统一的大规模结构化数据模型(LDM),通过上下文条件掩码建模实现分类、回归、缺失值填补、数据生成等多任务的单模型泛化
自适应专家调度与内存协调的MoE推理运行时系统,通过动态步长预测和缓存感知路由消除99.9%等待延迟。
标准 Transformer 注意力机制的二次复杂度在长上下文场景下成为瓶颈。虽然线性注意力方法(如 Mamba2、Gated DeltaNet)可以降低计算复杂度,但它们在表达能力和实际性能上通常不如全注意力机制。
长上下文建模能力已成为下一代大语言模型(LLM)的关键能力。许多新兴应用(如长文档理解、仓库级代码分析、自主 Agent 系统、长链推理)需要LLM 处理跨越数十万到数百万 token 的序列。
通过解耦视觉稀疏性,在预填充和解码阶段分别进行查询无关剪枝和查询感知检索,实现高效VLM推理
Transformer 注意力机制的二次复杂度在长上下文训练中成为主要瓶颈。当前研究沿两个方向推进:
LongCat-Flash 技术报告,探索大语言模型高效推理与训练加速。
强化学习(RL)在推进通用人工智能、具身智能和智能体智能方面展现出巨大潜力。然而,RL 工作流固有的异构性和动态性往往导致现有系统上硬件利用率低和训练缓慢。
全面综述人体运动生成技术,涵盖视觉、文本、音频三种模态,200+论文,10+子任务
LongCat-Video 技术报告,探索视频生成与理解的大语言模型方法。
通过金字塔Token合并和KV缓存压缩,在训练无关的方式下大幅加速视觉语言模型推理
ShaLa提出多模态共享潜空间建模方法,实现文本、图像等多模态信息的统一表示学习。
X-MoE是一种新型MoE训练系统,通过无填充训练管道、冗余绕过分发和序列分片MoE块等技术,在AMD GPU上实现DeepSeek风格MoE的高效可扩展训练
通过稳定性准则统一逐步和逐token稀疏决策的扩散模型加速框架
基于多模态大语言模型的级联系统,用于工业级视频内容审核,通过路由器-排序器架构降低计算成本
通过为每个 token 分配独立噪声级别,统一自回归预测与全序列扩散,在视频生成、决策规划和机器人控制中实现稳定长序列生成和灵活引导
首个十亿级短剧剧本-拍摄脚本对数据集,重新定义拍摄脚本格式以支持 AI 短剧生成,涵盖高光检测、世界布局理解和隐式角色关系挖掘
首个开源无限长度视频生成模型,融合 MLLM 结构化描述、多阶段预训练、运动质量强化学习和 Diffusion Forcing 框架,在 V-Bench 上达到开源模型最高分
基于预训练视频扩散 Transformer 的全音频条件说话人像生成与编辑统一框架,支持无限长度生成和多模态控制
首个17B参数的交互式世界基础模型,通过两阶段训练(无标签预训练+动作标注训练)实现Minecraft可控制视频生成,支持键盘/鼠标动作控制
统一多模态上下文学习框架,单架构支持参考图像到视频、视频到视频扩展和音频引导视频生成三大核心范式
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成
Llama 3 405B 模型在 16K H100 GPU 上的四维并行训练系统设计,涵盖灵活流水线并行、上下文并行、大规模调试方法及硬件建议
提出归纳矩匹配(IMM)框架,通过单阶段训练实现一步或少步生成,在ImageNet-256×256上以8步达到1.99 FID,超越扩散模型
首个多语言多条件语义检索数据集,通过对比重建框架提升检索性能45.9%
针对资源受限环境的低延迟视觉语言模型推理流水线
用于可扩展百万Token推理的上下文并行技术
首个面向晶圆级加速器(Cerebras WSE-2,85 万核)的 LLM 推理系统。提出 PLMR 设备模型刻画晶圆级硬件特征,配合细粒度二维并行、Shift 式 KV 缓存管理,以及 PLMR 合规的 MeshGEMM(两跳传输)与 MeshGEMV(K-tree allreduce),相比多卡 A100 SGLang 端到端提速 10–20×、能效 2–2.5×。
世界建模和视频生成已成为人工智能的核心挑战,需要合成时间连贯且逼真的序列。然而,大多数大规模视频扩散模型依赖全局条件去噪架构,同时处理整个时间序列,忽略了时间数据固有的因果结构。
Qwen3 系列大语言模型,集成思考模式和非思考模式,支持 0.6B 到 235B 参数规模
Lumos提出高效的大规模LLM训练性能建模与估算方法,支持训练资源优化配置。
通过异步KV缓存预取技术加速LLM推理吞吐量,减少内存访问延迟。
块级离散去噪扩散语言模型,在自回归和扩散之间插值,实现任意长度生成和 SOTA 似然
重新审视自回归与扩散的二分法,提出推理时扩展的两个轴:序列扩展和状态精炼
Tailwind CSS v4 introduces a CSS-first configuration, lightning-fast builds, and a new era for utility-first styling.
现代大语言模型(LLM)的自回归生成特性使其推理速度慢且成本高昂。投机解码(Speculative Sampling)已被证明是解决此问题的有效方案。EAGLE 系列方法通过在特征级进行自回归,复用目标模型的顶层特征,取得了比传统投机解码更好的效果。
COMET提出细粒度计算-通信重叠技术,优化混合专家模型的分布式推理效率。
大语言模型(LLM)处理长上下文的能力对 LLM agents 和长推理任务等新兴应用至关重要,这些应用现在可以处理扩展到数百万 token 的上下文窗口。在这些高要求的长上下文场景中,标准自回归解码的高推理延迟成为一个显著的瓶颈。
云原生LLM推理基础设施框架,通过协同设计实现高密度LoRA管理、分布式KV缓存和异构GPU调度
LServe通过统一稀疏注意力机制实现高效长序列LLM服务,优化KV缓存管理和注意力计算。
DiLoCo 等分布式优化方法将更新分为两部分:
探索VLM最小化极限,通过儿童学习启发的简单词汇数据集训练5M-25M参数的VLM,达到与1.3B模型竞争的性能
通过注意力图块化和一致性蒸馏实现视频扩散Transformer 7.4-7.8倍加速推理
通过剪枝感知预训练实现架构无关的高效边缘语言模型,首次将LLM压缩提升到预训练阶段
在现代大语言模型(LLM)推理引擎中,改善首 token 延迟(Time-to-First-Token, TTFT)是一个至关重要的目标。优化 TTFT 可以直接提高最大 QPS,并满足许多关键应用的需求。
A pragmatic approach to building a design system that scales with your startup without slowing you down.
大规模语言模型(LLM)训练通常分布 across 大量加速器以减少训练时间。由于内部状态和参数梯度需要在每个梯度步骤中交换,所有设备需要使用低延迟高带宽通信链路 co-locate。
通过长和丰富上下文(LRC)建模,增强视频多模态大语言模型的细粒度细节感知和长时序结构捕获能力
Learn how to build fast, content-focused websites with Astro's island architecture and zero-JS-by-default approach.
提出MPMD流水线并行训练方法,通过JAX/XLA编译器优化实现大规模深度学习训练的高效扩展。
Apple提出的高效视觉语言模型,通过新型混合视觉编码器FastViTHD实现85×更快的首token延迟,同时保持竞争性准确率
首个与双向扩散模型质量匹敌的自回归视频生成方法,通过非对称蒸馏将50步双向DiT蒸馏为4步因果生成器,实现9.4 FPS流式生成
通过动态输入剪枝和缓存感知掩码实现高效LLM推理,降低计算和内存开销。
Marconi为混合架构LLM提出高效前缀缓存机制,支持注意力层和非注意力层的统一缓存管理。
面向扩散 Transformer 的大规模并行推理引擎,混合多种并行策略实现 16 GPU 扩展
面向大规模分布式模型训练的故障机器检测系统,基于LSTM-VAE无监督异常检测与机器级相似性分析,实现秒级故障响应。
通过可学习的 AttnGate 门控机制和自蒸馏训练,直接从 LLM 学习块级注意力稀疏性,128K 序列下实现 7.3× 内核加速。
PipeFill利用流水线并行训练中的气泡时间执行额外计算任务,提升GPU利用率。
提出全流水线分布式Transformer架构,支持超长上下文语言模型的高效训练。
首个CXL共享内存故障模型,分类处理数据故障与进程故障,并提出适配CXL特性的冗余与一致性机制
Lazarus 是首个面向 MoE 模型的弹性容错训练系统,通过自适应专家副本分配和可证明最优的专家放置算法,在频繁节点故障下实现高达 5.7x 的性能提升
ReaL提出基于参数重分配的高效RLHF训练框架,通过动态调整GPU间的参数分布优化大语言模型对齐训练。
SampleAttention通过自适应结构化稀疏注意力实现长上下文LLM推理的近无损加速,显著降低首token延迟。
针对扩散 Transformer 的注意力压缩后训练方法,通过三种冗余消除技术实现高达 76% FLOPs 减少
大语言模型服务动态调度系统,支持KV缓存迁移与跨实例负载均衡
LeanAttention提出硬件感知的可扩展注意力机制,优化Transformer解码阶段的注意力计算效率。
多层级张量程序超级优化器,通过统一搜索空间生成高效注意力内核
QServe提出W4A8KV4量化与系统协同设计,通过QoQ算法和QServe推理库实现LLM服务吞吐量提升2.36倍,成本降低3倍。
通过三阶段渐进训练和6B参数视频编码器,在70+视频理解任务上实现SOTA性能的视频基础模型
在结构化稀疏加速器上实现非结构化稀疏加速,通过TASD方法弥合软硬件稀疏模式不匹配的鸿沟。
剑桥大学提出的CDL框架,通过结构、参数和时间三维度对因果深度学习进行系统分类,弥合因果推理与深度学习的鸿沟
EAGLE 系列是针对大语言模型(LLM)推理加速的投机解码(Speculative Decoding)方法,由 Yuhui Li 等人提出。该系列从特征级自回归、动态草稿树到训练时测试,逐步提升了投机解码的速度和效率。
首个系统性研究 Transformer 骨干用于潜空间视频扩散的工作。提出 4 种时空解耦的 Latte 变体,并通过大量消融确定视频生成的最佳实践(uniform patch embedding、S-AdaLN、绝对位置编码、图像-视频联合训练),在 4 个标准视频生成基准上达到 SOTA,并扩展到文生视频。
分布式低通信语言模型训练方法,通过内层优化器减少跨设备通信
大型自回归模型(如 Transformer)的推理速度很慢——解码 K 个 token 需要 K 次串行运行模型。这成为了部署大型语言模型的主要瓶颈。
序列建模的一个核心目标是设计一个单一的、有原则的模型,能够处理跨模态和任务的序列数据,特别是长程依赖(LRDs)。然而,传统模型包括 RNNs、CNNs 和 Transformers 的专门变体仍然难以扩展到 10000 步以上的超长序列。
通过非马尔可夫扩散过程实现 10-50× 加速采样的扩散模型