Hummingbird: SLO-Oriented GPU Preemption at Microsecond-scale
面向 SLO 的微秒级 GPU 抢占调度系统
13 posts tagged with "mllm"
面向 SLO 的微秒级 GPU 抢占调度系统
基于 MLLM 语义规划和 DiT 渲染的统一视频生成与编辑框架
8B参数高效多模态大语言模型,通过统一3D-Resampler、文档知识统一学习范式和混合强化学习实现性能与效率的平衡
面向多模态大模型的EPD阶段解耦推理系统,在昇腾NPU上实现57-69%吞吐量提升
通过非对称深度哈希加速长上下文LLM推理
阿里巴巴 Qwen 团队提出的统一图像生成与编辑基础模型,支持 1K token 指令输入,原生 2K 分辨率,多语言文本渲染。
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
首个多视频理解评估基准,评估MLLM在跨视频感知和推理方面的8项核心能力
首个十亿级短剧剧本-拍摄脚本对数据集,重新定义拍摄脚本格式以支持 AI 短剧生成,涵盖高光检测、世界布局理解和隐式角色关系挖掘
首个开源无限长度视频生成模型,融合 MLLM 结构化描述、多阶段预训练、运动质量强化学习和 Diffusion Forcing 框架,在 V-Bench 上达到开源模型最高分
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成
针对资源受限环境的低延迟视觉语言模型推理流水线
世界建模和视频生成已成为人工智能的核心挑战,需要合成时间连贯且逼真的序列。然而,大多数大规模视频扩散模型依赖全局条件去噪架构,同时处理整个时间序列,忽略了时间数据固有的因果结构。