Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
LingBot-Video — 首个开源大规模 MoE 视频基础模型,面向具身智能的单流扩散 Transformer,稀疏 MoE + 五阶段课程预训练 + 多维奖励 GRPO 后训练
33 posts tagged with "benchmark"
LingBot-Video — 首个开源大规模 MoE 视频基础模型,面向具身智能的单流扩散 Transformer,稀疏 MoE + 五阶段课程预训练 + 多维奖励 GRPO 后训练
用微基准测试解剖 NVIDIA Blackwell 消费级 GPU(GeForce RTX 5080, GB203)架构,并与上一代 Hopper(H100 PCIe, GH100)逐子系统对比——涵盖统一 INT32/FP32 核、精简 FP64、第五代张量核心(FP4/FP6)、内存层次(L1/L2/global)与真实负载(D-GEMM、Transformer 推理)功耗。
AMD 提出的 Chopper 多粒度 GPU 剖析框架,对 8 卡 MI300X 上 Llama 3 8B 的 FSDP 训练做端到端表征,揭示频率开销(DVFS)是理论与实测性能差距的最大来源。
NVIDIA Blackwell GPU 架构的综合技术综述——涵盖第五代张量核心(tcgen05、FP4/FP6)、张量内存 TMEM、硬件解压引擎 DE、重构内存层次(L1/L2/HBM3e/GDDR7)、双芯 B200 互连,以及与 Hopper/H200 的微基准对比与调优策略。综合自 Jarmusch et al. 两篇微基准论文。
UNT 与 William & Mary 提出的纯硬件 GEMM 卸载方案:在张量核心执行 GEMM 时,将部分 WMMA 指令翻译为 MAC 指令下放到空闲的 CUDA 核心并行执行,配合额外 load-store 单元缓解访存瓶颈,在 GPGPU-Sim 上最高提升 29% 性能,CUDA 核心利用率从近零提升至平均 ~73%。
rRCM reformulates generative denoising as discriminative latent-space learning for certified robustness with 85× speedup
A benchmark framework for evaluating LLMs' ability to generate fast and correct GPU kernels across 250 PyTorch workloads
A systematic analysis of NVIDIA NCCL's internal architecture covering API, protocols, transports, and collective algorithms
首个全面评估 LLM 效率技术的大规模基准测试,涵盖架构预训练、微调和量化推理
从生产实践角度重新审视KV缓存压缩技术,揭示吞吐量、响应长度和负样本三个被忽视的关键维度
NVIDIA B200 GPU 微基准测试与架构深度分析
AMD MI300A 上 FP8 矩阵核心、异步执行和结构化稀疏的执行特征分析
面向少步自回归世界模型推理的跨分块缓存加速
NVIDIA 实时生成式世界模型用于闭环自动驾驶仿真
通过组合权重稀疏性和数据稀疏性提升 MoE 计算效率
模型驱动的代码预训练数据构建方法,最小化人工干预
面向单个消费级GPU的高效长上下文LLM推理系统,通过自适应分层KV管理实现3.46倍加速
解耦视觉语言模型,通过粗到细两阶段策略实现高效高分辨率文档解析
基于查询感知模型扩展的文本到图像扩散模型高效服务系统
通过级联规划器(EAM+EAP)实现高效专家预取,在资源受限设备上加速MoE推理,吞吐量提升65.13%
面向自动张量化程序优化的编译器抽象,通过Block抽象实现硬件张量计算原语的自动利用
Polar:在任意Agent Harness上规模化进行Agentic RL训练
MiniMax-M2系列:小型激活释放最大真实世界智能
BFloat16精度下RoPE在长上下文训练中的问题与AnchorAttention解决方案
从 128K 到 4M:高效训练超长上下文大语言模型
长上下文注意力基准测试:从内核效率到分布式上下文并行
Routing-Free MoE 提出无需路由的混合专家模型架构。
基于稀疏混合专家的自适应计算实时目标检测框架,通过动态路由实现按场景复杂度分配计算资源。
ProCache提出约束感知的特征缓存与选择性计算方法,加速扩散Transformer模型的推理过程。
首个多视频理解评估基准,评估MLLM在跨视频感知和推理方面的8项核心能力
LongCat-Video 技术报告,探索视频生成与理解的大语言模型方法。
统一多模态上下文学习框架,单架构支持参考图像到视频、视频到视频扩展和音频引导视频生成三大核心范式
探索VLM最小化极限,通过儿童学习启发的简单词汇数据集训练5M-25M参数的VLM,达到与1.3B模型竞争的性能