SkyReels V1-V4 系列论文总结
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
8 posts tagged with "audio"
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
阿里巴巴Qwen团队的统一多模态模型,在文本、图像、音频、视频上无性能退化
开源可控文本到语音系统,支持多说话人、多轮对话和自然语言指令控制
通过跨模态上下文学习改进联合音视频生成
NVIDIA Jetson平台优化的本地大语言模型推理框架,支持量化、多模态、语音、向量数据库和RAG
基于预训练视频扩散 Transformer 的全音频条件说话人像生成与编辑统一框架,支持无限长度生成和多模态控制
统一多模态上下文学习框架,单架构支持参考图像到视频、视频到视频扩展和音频引导视频生成三大核心范式
首个同时支持多模态输入、联合视频-音频生成、统一生成/修复/编辑的视频基础模型,采用双流 MMDiT 架构,支持 1080p 32FPS 15秒电影级视频生成