UniWorld-Design: From Pixel Generation to Layer-Native Design
基于语义 RGBA 图层的原生视觉设计框架:T2RGBA 文本生成 RGBA 资产 + I2L 指令驱动的图像分层解构
31 posts tagged with "image-generation"
基于语义 RGBA 图层的原生视觉设计框架:T2RGBA 文本生成 RGBA 资产 + I2L 指令驱动的图像分层解构
训练无关的通用稀疏注意力,加速所有模型推理(语言、图像、视频生成)
基于 FP8 Matmul + FP16 累加器指令进一步加速 SageAttention2 的注意力量化内核实现,在保持精度的同时取得相对 FlashAttention 最高 3.9× 加速。
Jointly trained conditional and unconditional diffusion model enabling guidance without a separate classifier, achieving similar quality-diversity tradeoff as classifier guidance with simpler training
无仿真训练连续归一化流(CNF)的新范式:通过回归条件概率路径的向量场,统一并超越扩散模型,并引入最优传输(OT)路径
DiT 用在 latent patch 上操作的 Transformer 替换扩散模型常用的 U-Net 骨干,提出 adaLN-Zero 条件注入块,证明 Gflops(通过增大深度/宽度或 token 数)与 FID 强负相关;DiT-XL/2 在 ImageNet 256×256 取得 SOTA FID 2.27,是 Sora/SD3/FLUX 等现代生成模型的架构基石。
Stability AI 的 SD3 论文:改进的 Rectified Flow 时间步采样 + 多模态 MM-DiT 架构,在高分辨率文生图上超越 DALL·E 3 等 SOTA
PPFlow 用金字塔分块化(高噪声时间步用大 patch、低噪声时间步用小 patch)替换 DiT 固定 patch size,仅切换 Patchify/Unpatchify 线性投影而共享 DiT blocks,实现 1.6–2.0× 去噪加速且质量不降,从预训练模型适配仅需 +8.9% 训练 FLOPs。
腾讯混元原生多模态模型:在自回归框架内统一多模态理解与生成,80B MoE(激活 13B),当前最大最强开源图像生成模型
DDiT 提出测试时(training-free)动态分块策略——根据内容复杂度与去噪时间步自适应调整 patch size:高噪声步用粗 patch 建模全局结构、低噪声步用细 patch 精修局部细节;通过三阶有限差分度量潜表示演化速率驱动调度器,在 FLUX-1.Dev / Wan 2.1 上实现最高 3.52×/3.2× 加速且不损画质。
DC-DiT 用学习式 encoder-router-decoder 支架替换扩散 Transformer 的固定 patchify,端到端学习内容自适应的动态分块 tokenization,实现跨空间/时间步的自适应计算与单一 checkpoint 弹性推理,FLOPs 降低 36.8%、FID 提升 37.8%。
Mario Larcher 在 Towards Data Science 对 DiT 论文《Scalable Diffusion Models with Transformers》的教学式讲解精读,含扩散公式、无分类器引导、潜在扩散、Patchify、adaLN-Zero 等背景与核心设计
MrFlow achieves 10x+ training-free acceleration for flow-matching diffusion models via a four-stage low-to-high resolution pipeline
统一多模态理解与生成模型综述:系统梳理三大架构范式(扩散/自回归/混合),数据集与基准测试
统一多模态基础模型,融合空间增强 MLLM 与 MMDiT,实现理解/生成/编辑一体化,支持空间推理
去噪扩散概率模型
高效视频目标分割与跟踪模型
通过差分缩放和动态间隔缓存实现 DiT 的极端加速
Qwen 图像生成基础模型技术报告
高保真仿真就绪3D内容生成系统,支持场景布局、部件分解和铰接生成
8B参数高效多模态大语言模型,通过统一3D-Resampler、文档知识统一学习范式和混合强化学习实现性能与效率的平衡
PostDiff:免训练扩散模型压缩框架,通过混合分辨率去噪和混合模块缓存降低单步推理成本
基于查询感知模型扩展的文本到图像扩散模型高效服务系统
轻量级原生统一多模态模型,通过双流MoE架构和多任务协同训练实现图像视频理解、生成与编辑
阿里巴巴 Qwen 团队提出的统一图像生成与编辑基础模型,支持 1K token 指令输入,原生 2K 分辨率,多语言文本渲染。
Qwen-Image-2.0 全能图像生成基础模型,支持文本到图像生成和图像编辑。
OmniGen2 提出指令对齐的多模态生成框架,统一文本到图像、图像编辑和多模态理解任务。
Matrix-3D 提出从单张图像生成全方位可探索 3D 世界的统一框架。
ProCache提出约束感知的特征缓存与选择性计算方法,加速扩散Transformer模型的推理过程。
块级离散去噪扩散语言模型,在自回归和扩散之间插值,实现任意长度生成和 SOTA 似然
Apple提出的高效视觉语言模型,通过新型混合视觉编码器FastViTHD实现85×更快的首token延迟,同时保持竞争性准确率