Make It Long, Keep It Fast: End-to-End 10K Long User Behavior Sequence Modeling for Billion-Scale Douyin Recommendation
STCA 将历史自注意力替换为目标-历史交叉注意力,复杂度从 O(L²) 降至 O(L),RLB 在请求级复用用户编码,实现 10K 长序列端到端训练,已部署于抖音全量流量
4 posts tagged with "industrial-deployment"
STCA 将历史自注意力替换为目标-历史交叉注意力,复杂度从 O(L²) 降至 O(L),RLB 在请求级复用用户编码,实现 10K 长序列端到端训练,已部署于抖音全量流量
在 YouTube 排序模型中验证 Semantic ID 替代随机视频 ID,通过 RQ-VAE 量化内容嵌入为离散语义 token,提升冷启动和长尾物品的泛化能力
Generative Recommenders (GR) 将推荐重新定义为序列转导任务,HSTU 编码器比 FlashAttention2 Transformer 快 5.3x-15.2x,1.5 万亿参数模型在线 A/B 测试提升 12.4%
UG-Sep 在 TokenMixer 架构中解耦用户侧和物品侧信息流,实现用户侧计算复用,推理延迟降低 20%,已部署于字节跳动多个业务场景