Back to blog

Compute Only Once: UG-Separation for Efficient Large Recommendation Models

UG-Sep 在 TokenMixer 架构中解耦用户侧和物品侧信息流,实现用户侧计算复用,推理延迟降低 20%,已部署于字节跳动多个业务场景

Compute Only Once: UG-Separation for Efficient Large Recommendation Models

一、论文概述

项目内容
标题Compute Only Once: UG-Separation for Efficient Large Recommendation Models
作者Hui Lu, Zheng Chai, Shipeng Bai, Hao Zhang, Zhifang Fan, Kunmin Bai, Ke Sun, Yingwen Wu, Bingzheng Wei, Xiang Sun, Ziyan Gong, Tianyi Liu, Hua Chen, Deping Xie
机构ByteDance (字节跳动)
论文arXiv:2602.10455
发布2026-02-11 (v1), 2026-05-20 (v2)
许可未明确

二、核心思想

问题定义

推荐系统通过 scaling law 持续扩大模型规模,但面临推理成本瓶颈:

方向方法计算复用问题
长序列建模HSTU, LONGER, M-Falcon用户侧 KV-Cache 可复用
大稠密特征交互TokenMixer用户-物品信息深度纠缠,无法复用

核心矛盾:TokenMixer 架构中用户侧和物品侧信息在每一层混合,导致每次候选物品变化时所有计算需重新执行。

解决方案概述

UG-Sep (User-Group Separation) 首次实现 TokenMixer 架构中的用户侧计算复用:

  1. UG Token 分离:将输入 token 明确分为纯用户侧 (U-tokens) 和混合侧 (G-tokens)
  2. UG 交互分离:通过分离 mask 防止 G 侧信息污染 U 侧
  3. 信息补偿:自适应重建被 mask 抑制的用户-物品交互
  4. W8A16 量化:8-bit 权重量化缓解 UG-Sep 暴露的内存瓶颈

三、技术架构

整体框架图

TokenMixer with UG-Sep

UG-Sep Framework
├── Stage 1: Feature Extraction (Bottom Layers)
│   ├── U-side Branch: SENet, DCN → Pure user features
│   ├── G-side Branch: Complex modules → Mixed features
│   └── Output: U-tokens (pure user) + G-tokens (user+group)
├── Stage 2: TokenMixer with UG-Sep (Middle/Upper Layers)
│   ├── Mixup Operation (with UG mask)
│   │   ├── U→U: allowed (user self-interaction)
│   │   ├── U→G: allowed (user influences group)
│   │   ├── G→U: BLOCKED (group cannot affect user)
│   │   └── G→G: allowed (group self-interaction)
│   ├── PertokenFFN
│   ├── Information Compensation (optional)
│   └── Separated Residual Connection
├── Stage 3: Inference (KV-Cache for U-side)
│   ├── Compute U-side representations ONCE
│   ├── Cache U-side KV for all candidates
│   ├── For each candidate: only compute G-side
│   └── Theoretical speedup: c_u / (c_u + c_g)
└── Stage 4: W8A16 Quantization
    ├── 8-bit weights (FP8)
    ├── 16-bit activations (BF16)
    └── 4x memory reduction, negligible dequant cost

核心公式

TokenMixer 架构:

Pk−1=LN(Mixup(Xk−1))P_{k-1} = \text{LN}(\text{Mixup}(X_{k-1}))

Xk=LN(PFFN(Pk−1)+Xk−1)X_k = \text{LN}(\text{PFFN}(P_{k-1}) + X_{k-1})

UG 分离后的 token 表示:

X=Concat(xu0,xu1,⋯ ,xun−1,xg0,xg1,⋯ ,xgm−1)X = \text{Concat}(x_{u^0}, x_{u^1}, \cdots, x_{u^{n-1}}, x_{g^0}, x_{g^1}, \cdots, x_{g^{m-1}})

其中 xux_u 是 U-side token,xgx_g 是 G-side token,nn 是 U token 数量,mm 是 G token 数量。

分离 mask:

Mij={1if (i∈U∧j∈U)∨(i∈U∧j∈G)∨(i∈G∧j∈G)0if i∈G∧j∈UM_{ij} = \begin{cases} 1 & \text{if } (i \in U \land j \in U) \lor (i \in U \land j \in G) \lor (i \in G \land j \in G) \\ 0 & \text{if } i \in G \land j \in U \end{cases}

信息补偿:

U^=Proj(U)\hat{U} = \text{Proj}(U) Gcomp=G+U^G_{\text{comp}} = G + \hat{U}

推理加速比:

ratio=cucu+cg\text{ratio} = \frac{c_u}{c_u + c_g}

分离 mask 可视化

Separated Residual

Mixup Attention Mask (H heads × D' dims)
         U-tokens    G-tokens
U-tokens  [✓ ✓ ✓]    [✓ ✓ ✓]    ← U can attend to all
G-tokens  [✗ ✗ ✗]    [✓ ✓ ✓]    ← G cannot attend to U

信息补偿机制

Information Compensation

问题:UG mask 会移除 G-side token 中与 U-side 相关的维度信息

解决方案:将 U-side 信息显式注入 G-side 表示

Gcomp=G+Proj(U)G_{\text{comp}} = G + \text{Proj}(U)

四、核心创新

创新点说明理论/实验依据
UG Token 分离将输入明确分为 U-tokens 和 G-tokens图 1
UG 交互分离通过 mask 阻止 G→U 信息流图 2,公式 5-6
Separated Residual跨 attention 处理金字塔结构图 2
Information Compensation自适应重建被 mask 的信息图 3,表 3
W8A16 量化8-bit 权重缓解内存瓶颈表 4
工业部署字节跳动多个业务场景 A/B 测试表 5-6

五、实验结果

离线评估 - AUC

场景U:GΔAUCΔLatency
Douyin Feed Recbase––
1:2+0.002%–
1:1-0.004%-20.0%
3:1-0.013%–
Hongguo Feed Recbase––
1:1-0.018%-11.5%
5:3-0.015%–
Chuanshanjia Adsbase––
1:1-0.016%-12.7%
5:3-0.026%–
Qianchuan Adsbase––
1:1-0.024%-22.0%

关键发现:

  • AUC 变化在 ±0.03% 以内,经 A/B 测试验证对在线性能无显著影响
  • 1:1 比例在精度和效率间取得最佳平衡
  • 延迟降低 11.5%-22.0%,模型越大收益越明显

训练加速

模型U:GTraining Speedup
TokenMixer–0.0%
+ UG-Sep1:2+5.50%
+ UG-Sep1:1+8.60%
+ UG-Sep3:1+14.8%

消融实验 - Information Compensation

U:GInfo CompensationΔAUC
1:2N+0.00%
1:1N-0.01%
2:1N-0.04%
3:1N-0.06%
3:1Y-0.02%
5:1Y-0.04%

发现:当 U:G 比例增大时,信息补偿模块的关键作用显现,AUC 从 -0.06% 恢复到 -0.02%。

W8A16 量化效果

配置Latency 降低
(1,16, 1280, 2560)-50.2%
(1,16, 1280, 640)-40.0%
(1,8, 1280, 2560)-46.8%
(1,8, 1280, 640)-55.0%

在线 A/B 测试

Douyin 推荐系统:

指标变化pp-value
Active Days-0.002%0.46
Duration+0.006%0.45
Like-0.051%0.34
HLT-0.000%0.95
Comment-0.092%0.18
Latency-20.0%–

穿山甲广告:

指标变化pp-value
Cost-0.114%0.45
Rank Advv-0.132%0.42
Advv (Overall)-0.204%0.32
Latency-12.7%–

发现:所有指标的 pp-value 均 > 0.18,无统计显著差异,同时延迟降低 12.7%-20.0%。

六、模型配置

实验环境

参数值
业务场景Douyin Feed Rec, Hongguo Feed Rec, Chuanshanjia Ads, Qianchuan Ads
特征规模数百到数千特征字段
用户规模数十亿用户 ID
物品规模数亿视频/广告 ID
嵌入方式稀疏嵌入
评估指标AUC (相对变化)
基线模型TokenMixer 架构

TokenMixer 配置

参数值
架构Multi-Head Token Mixing + PertokenFFN
层归一化LayerNorm
残差连接Separated Residual
分离 maskU→U ✓, U→G ✓, G→U ✗, G→G ✓

W8A16 配置

参数值
权重精度FP8 (8-bit)
激活精度BF16 (16-bit)
内存节省4x (vs FP32), 2x (vs BF16)
反量化开销可忽略

七、相关工作

工作方法与 UG-Sep 的差异
HSTU高效自注意力 + KV-Cache仅适用于序列模型
LONGER全局 token + 系统优化长序列场景
M-Falcon微批次并行 + KV-Cache检索阶段优化
TokenMixer全 token 交叉交互无 UG 分离
UniRec统一序列推荐框架任务级复用

八、总结

核心贡献

  1. 首次实现:在 TokenMixer 架构中实现用户侧计算复用
  2. UG 分离框架:通过 token 分离和交互 mask 解耦用户-物品信息流
  3. 信息补偿:自适应重建被 mask 抑制的用户-物品交互
  4. W8A16 量化:8-bit 权重量化进一步降低内存瓶颈
  5. 工业验证:字节跳动 4 个业务场景大规模 A/B 测试
  6. 显著加速:推理延迟降低 11.5%-22.0%,在线指标无显著变化

技术影响

  • 推荐系统效率:为 TokenMixer 架构提供通用加速方案
  • Scaling Law 支持:使更大规模的稠密交互模型可部署
  • 跨平台适用:适用于推荐、广告等多个业务场景
  • 计算复用范式:从序列级扩展到特征交互级

局限性

  • 架构依赖:仅适用于 TokenMixer 风格架构
  • U:G 比例敏感:过高比例需要信息补偿,可能引入额外复杂度
  • 训练加速有限:仅在用户级聚合训练中有效
  • 量化精度:W8A16 可能在某些场景引入微小精度损失
  • 评估范围:主要在字节跳动内部验证

九、参考资源

  • 论文: arXiv:2602.10455
  • 相关工作:
  • 应用场景:
    • Douyin (抖音) 推荐系统
    • Hongguo (红果) 推荐系统
    • 穿山甲广告平台
    • 巨量千川广告平台