Back to blog

BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching

通过O(1)主机缓存实现快速、实时的大模型自动扩展

BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching

一、论文概述

项目内容
标题BlitzScale: Fast and Live Large Model Autoscaling with O(1) Host Caching
作者Dingyan Zhang 等
机构SJTU IPADS
论文OSDI 2025
代码未明确
发布2025-07 (OSDI 2025)
领域Systems, Model Serving

二、核心思想

问题定义

模型自动扩展是实现无服务器模型即服务的关键机制,但面临扩展速度与存储/内存使用之间的根本权衡:

  1. 扩展速度慢:数据平面性能慢,扩展实例在参数加载期间停止
  2. 缓存开销大:需要大量缓存来存储参数
  3. 多主机扩展困难:无法满足跨多主机的频繁扩展需求

解决方案概述

BlitzScale通过两个关键创新解决这些问题:

  1. 快速数据平面:通过GPU间计算网络加载参数,无需或仅需O(1)缓存
  2. 实时扩展:将扩展抽象从粗粒度实例级细化到细粒度层级

三、技术架构

核心设计

组件说明关键特点
GPU计算网络加载通过GPU互连加载参数速度接近主机缓存
网络优化多播多实例扩展的优化O(1)缓存
层级扩展细粒度层级别扩展实时扩展

关键技术

快速数据平面:

  • 通过GPU间计算网络加载参数
  • 计算网络速度接近主机缓存且未充分利用
  • 多实例扩展无需或仅需O(1)缓存

实时扩展:

  • 将扩展抽象从实例级细化到层级
  • 允许将过载实例的层计算卸载到扩展实例
  • 无需等待参数完全加载

网络优化多播:

  • 优化多实例扩展的参数分发
  • 减少缓存需求
  • 提高扩展效率

四、核心创新

创新点说明理论/实验依据
GPU网络加载通过计算网络加载参数速度接近主机缓存
O(1)缓存无需大量缓存网络优化多播
实时扩展层级别细粒度扩展无需等待完全加载
快速数据平面提高数据平面性能消除扩展瓶颈

五、实验结果

关键优势

  • 快速扩展:通过GPU网络加载参数,速度接近主机缓存
  • 低缓存开销:O(1)缓存,无需大量存储
  • 实时扩展:层级别扩展,无需等待完全加载
  • 多主机支持:支持跨多主机的频繁扩展

应用场景

  • 无服务器模型即服务
  • 频繁扩展需求
  • 多主机环境

六、相关工作

方向代表工作BlitzScale的优势
模型服务各种服务系统快速实时扩展
自动扩展传统自动扩展O(1)缓存,实时扩展
参数加载主机缓存利用GPU网络

七、总结

核心贡献

  1. 快速数据平面:通过GPU网络加载参数,无需大量缓存
  2. 实时扩展:层级别细粒度扩展
  3. O(1)缓存:网络优化多播减少缓存需求
  4. 消除扩展瓶颈:解决扩展速度与缓存开销的权衡

技术影响

  • 无服务器模型服务:实现真正的无服务器模型即服务
  • 资源效率:减少缓存开销
  • 扩展性能:提高扩展速度和实时性

局限性

  • 需要GPU间高速互连
  • 可能增加网络负载
  • 对某些工作负载可能收益有限

八、参考资源

  • 论文: OSDI 2025
  • 机构: SJTU IPADS
  • 会议: OSDI 2025
  • 应用场景: 无服务器模型服务、自动扩展