Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
NVFP4 量化精度提升的自适应块缩放方法
11 posts tagged with "architecture"
NVFP4 量化精度提升的自适应块缩放方法
通过稀疏性诱导提升 LLM 后训练剪枝精度
NVIDIA Jetson平台优化的本地大语言模型推理框架,支持量化、多模态、语音、向量数据库和RAG
SparseVLM 和 SparseVLM+ 的完整技术分析,涵盖文本引导的视觉Token稀疏化方法、注意力重力校正、优先头选择等核心创新
FlashAttention 常用接口介绍,包括基本使用方法和性能优化技巧。
Lumos提出高效的大规模LLM训练性能建模与估算方法,支持训练资源优化配置。
通过异步KV缓存预取技术加速LLM推理吞吐量,减少内存访问延迟。
LeanAttention提出硬件感知的可扩展注意力机制,优化Transformer解码阶段的注意力计算效率。
EAGLE 系列是针对大语言模型(LLM)推理加速的投机解码(Speculative Decoding)方法,由 Yuhui Li 等人提出。该系列从特征级自回归、动态草稿树到训练时测试,逐步提升了投机解码的速度和效率。
大型自回归模型(如 Transformer)的推理速度很慢——解码 K 个 token 需要 K 次串行运行模型。这成为了部署大型语言模型的主要瓶颈。
序列建模的一个核心目标是设计一个单一的、有原则的模型,能够处理跨模态和任务的序列数据,特别是长程依赖(LRDs)。然而,传统模型包括 RNNs、CNNs 和 Transformers 的专门变体仍然难以扩展到 10000 步以上的超长序列。