EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation
通过知识蒸馏和模态自适应剪枝压缩视觉语言模型
EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning |
| 作者 | Tiannan Wang, Wangchunshu Zhou, Yan Zeng, Xinsong Zhang |
| 论文 | https://arxiv.org/abs/2210.07795 |
| 代码 | https://github.com/swaggy-TN/EfficientVLM |
| 发布 | 2022-10-14 |
二、核心思想
问题定义
预训练视觉语言模型(VLMs)通常包含数亿参数,在微调和部署时面临空间、内存和延迟约束的挑战。需要一种方法将大型 VLM 压缩为更小、更快、更准确的模型。
解决方案概述
提出”先蒸馏后剪枝”(distilling then pruning)框架:
- 蒸馏阶段:在视觉语言预训练阶段应用知识蒸馏,获得任务无关的紧凑 VLM
- 剪枝阶段:提出模态自适应剪枝算法,自动推断视觉和语言模态对不同下游任务的重要性,自适应地移除冗余结构和神经元
三、技术架构
模型结构
EfficientVLM 由以下组件组成:
- 视觉编码器:6 层
- 文本编码器:3 层
- 跨模态融合层:3 层
- 总参数量:93M(仅为教师模型的 44.3%)
核心方法
1. 知识蒸馏
- 在预训练阶段从大型教师 VLM 蒸馏到紧凑学生模型
- 任务无关的蒸馏,保持通用性
2. 模态自适应剪枝
- 自动推断视觉和语言模态的重要性
- 根据不同下游任务自适应剪枝
- 支持可控的目标稀疏度
四、核心创新
| 创新点 | 说明 |
|---|---|
| 先蒸馏后剪枝框架 | 两阶段压缩,先获得通用紧凑模型,再针对任务自适应剪枝 |
| 模态自适应剪枝 | 根据任务自动调整视觉/语言模态的剪枝比例 |
| 可控稀疏度 | 用户可指定目标稀疏度 |
五、实验结果
性能保持
- 保留教师模型 98.4% 的性能
- 推理速度提升 2.2x
与现有方法对比(vs 同规模 SoTA)
| 任务 | 提升 |
|---|---|
| VQAv2 | +4.9% |
| NLVR2 | +5.6% |
| ITR (R@1 on TR) | +17.2% |
| ITR (R@1 on IR) | +15.6% |
| COCO caption (CIDEr) | +6.5 |
六、总结
核心贡献
- 提出”先蒸馏后剪枝”的 VLM 压缩框架
- 设计模态自适应剪枝算法,根据任务特性自动调整剪枝策略
- 训练出 93M 参数的 EfficientVLM,在多个 VL 任务上大幅超越同规模方法
技术影响
为轻量化 VLM 提供了有效的压缩范式,证明了通过知识蒸馏和自适应剪枝可以在大幅减小模型尺寸的同时保持高性能。