Movie Gen: 媒体基础模型全家桶
Meta 的 Movie Gen 媒体基础模型全家桶:30B 文生视频 + 13B 视频音频生成,Flow Matching + LLaMa3 风格 Transformer,支持 1080p HD 视频、同步音频、个性化与指令式视频编辑,多任务达到 SOTA。
6 posts tagged with "audio-generation"
Meta 的 Movie Gen 媒体基础模型全家桶:30B 文生视频 + 13B 视频音频生成,Flow Matching + LLaMa3 风格 Transformer,支持 1080p HD 视频、同步音频、个性化与指令式视频编辑,多任务达到 SOTA。
阿里巴巴Qwen团队的统一多模态模型,在文本、图像、音频、视频上无性能退化
开源可控文本到语音系统,支持多说话人、多轮对话和自然语言指令控制
基于查询感知模型扩展的文本到图像扩散模型高效服务系统
优化树结构LLM推理的注意力内核和运行时
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成