BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching
通过O(1)主机缓存实现快速、实时的大模型自动扩展
BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching
一、论文概述
| 项目 | 内容 |
|---|---|
| 标题 | BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching |
| 作者 | Dingyan Zhang 等 |
| 机构 | SJTU IPADS |
| 论文 | OSDI 2025 |
| 代码 | 未明确 |
| 发布 | 2025-07 (OSDI 2025) |
| 领域 | Systems, Model Serving |
二、核心思想
问题定义
模型自动扩展是实现无服务器模型即服务的关键机制,但面临扩展速度与存储/内存使用之间的根本权衡:
- 扩展速度慢:数据平面性能慢,扩展实例在参数加载期间停止
- 缓存开销大:需要大量缓存来存储参数
- 多主机扩展困难:无法满足跨多主机的频繁扩展需求
解决方案概述
BlitzScale通过两个关键创新解决这些问题:
- 快速数据平面:通过GPU间计算网络加载参数,无需或仅需O(1)缓存
- 实时扩展:将扩展抽象从粗粒度实例级细化到细粒度层级
三、技术架构
核心设计
| 组件 | 说明 | 关键特点 |
|---|---|---|
| GPU计算网络加载 | 通过GPU互连加载参数 | 速度接近主机缓存 |
| 网络优化多播 | 多实例扩展的优化 | O(1)缓存 |
| 层级扩展 | 细粒度层级别扩展 | 实时扩展 |
关键技术
快速数据平面:
- 通过GPU间计算网络加载参数
- 计算网络速度接近主机缓存且未充分利用
- 多实例扩展无需或仅需O(1)缓存
实时扩展:
- 将扩展抽象从实例级细化到层级
- 允许将过载实例的层计算卸载到扩展实例
- 无需等待参数完全加载
网络优化多播:
- 优化多实例扩展的参数分发
- 减少缓存需求
- 提高扩展效率
四、核心创新
| 创新点 | 说明 | 理论/实验依据 |
|---|---|---|
| GPU网络加载 | 通过计算网络加载参数 | 速度接近主机缓存 |
| O(1)缓存 | 无需大量缓存 | 网络优化多播 |
| 实时扩展 | 层级别细粒度扩展 | 无需等待完全加载 |
| 快速数据平面 | 提高数据平面性能 | 消除扩展瓶颈 |
五、实验结果
关键优势
- 快速扩展:通过GPU网络加载参数,速度接近主机缓存
- 低缓存开销:O(1)缓存,无需大量存储
- 实时扩展:层级别扩展,无需等待完全加载
- 多主机支持:支持跨多主机的频繁扩展
应用场景
- 无服务器模型即服务
- 频繁扩展需求
- 多主机环境
六、相关工作
| 方向 | 代表工作 | BlitzScale的优势 |
|---|---|---|
| 模型服务 | 各种服务系统 | 快速实时扩展 |
| 自动扩展 | 传统自动扩展 | O(1)缓存,实时扩展 |
| 参数加载 | 主机缓存 | 利用GPU网络 |
七、总结
核心贡献
- 快速数据平面:通过GPU网络加载参数,无需大量缓存
- 实时扩展:层级别细粒度扩展
- O(1)缓存:网络优化多播减少缓存需求
- 消除扩展瓶颈:解决扩展速度与缓存开销的权衡
技术影响
- 无服务器模型服务:实现真正的无服务器模型即服务
- 资源效率:减少缓存开销
- 扩展性能:提高扩展速度和实时性
局限性
- 需要GPU间高速互连
- 可能增加网络负载
- 对某些工作负载可能收益有限
八、参考资源
- 论文: OSDI 2025
- 机构: SJTU IPADS
- 会议: OSDI 2025
- 应用场景: 无服务器模型服务、自动扩展