CapKV: Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective
基于信息瓶颈原理统一解释KV缓存驱逐方法,提出CapKV——通过统计杠杆分数最大化对数行列式容量目标,显著提升长上下文推理的性能-内存权衡
7 posts tagged with "transformer"
基于信息瓶颈原理统一解释KV缓存驱逐方法,提出CapKV——通过统计杠杆分数最大化对数行列式容量目标,显著提升长上下文推理的性能-内存权衡
ByteDance's FSVideo achieves 42.3x speedup over Wan2.1 via 64×64×4 compression autoencoder, layer memory self-attention DIT, and few-step latent upsampler
DiT 用在 latent patch 上操作的 Transformer 替换扩散模型常用的 U-Net 骨干,提出 adaLN-Zero 条件注入块,证明 Gflops(通过增大深度/宽度或 token 数)与 FID 强负相关;DiT-XL/2 在 ImageNet 256×256 取得 SOTA FID 2.27,是 Sora/SD3/FLUX 等现代生成模型的架构基石。
Stability AI 的 SD3 论文:改进的 Rectified Flow 时间步采样 + 多模态 MM-DiT 架构,在高分辨率文生图上超越 DALL·E 3 等 SOTA
Mario Larcher 在 Towards Data Science 对 DiT 论文《Scalable Diffusion Models with Transformers》的教学式讲解精读,含扩散公式、无分类器引导、潜在扩散、Patchify、adaLN-Zero 等背景与核心设计
Transformer 架构的开创性工作 - 纯注意力机制的序列转导模型
Transformer 推理全栈优化综述,涵盖硬件设计、软件优化、调度策略和神经架构搜索