Back to blog

Large Language Models for Generative Recommendation: A Survey and Visionary Discussions

LLM 生成式推荐综述,探讨如何将推荐系统从多阶段判别式流程转变为单阶段生成式流程

Large Language Models for Generative Recommendation: A Survey and Visionary Discussions

论文信息: arXiv:2309.01157 [cs.IR] 3 Sep 2023

作者: Lei Li, Yongfeng Zhang, Dugang Liu, Li Chen

会议: LREC-COLING 2024

许可: arXiv 非独占分发许可


一、论文概述

1.1 研究背景

大语言模型(LLM)不仅革命性地改变了自然语言处理领域,还有潜力重塑许多其他领域,如推荐系统(RS)。然而,大多数相关工作将 LLM 作为传统推荐管道的一个组件(如特征提取器),这可能无法充分发挥 LLM 的生成能力。

核心问题:

问题说明
判别式推荐的局限多阶段流程导致学术研究与工业应用脱节
LLM 的潜力可将多阶段流程简化为单阶段生成式推荐
ID 表示问题需要简洁且唯一的 ID 表示来精确区分用户和物品

1.2 核心贡献

贡献说明
重新定义 ID将 ID 泛化为可唯一标识实体的 token 序列
生成式推荐框架提出从完整物品池直接生成推荐的范式
任务分类总结七类典型的生成式推荐任务
挑战与机遇讨论 LLM 代理、幻觉、偏见等关键问题

二、核心思想

2.1 问题定义

传统推荐系统采用判别式方法,需要计算每个物品的排序分数,计算成本高昂。工业级 RS 通常采用多阶段流程来缩小候选物品范围,这导致学术研究与工业应用之间存在差距。

判别式推荐 vs 生成式推荐:

特性判别式推荐生成式推荐
流程多阶段(召回→粗排→精排→重排)单阶段(直接生成)
计算对每个物品计算分数生成 token 序列构成物品 ID
候选集从前一阶段的子集抽取隐式枚举所有候选物品
LLM 角色特征提取器核心生成模型

2.2 解决方案概述

Pipeline 对比 图 1:传统推荐系统与 LLM 生成式推荐的流程对比

生成式推荐的核心优势:

  1. 有限 token 表示无限物品:使用有限的 token 可以表示几乎无限的物品

    • 假设 1000 个 token,每个 ID 由 10 个 token 组成
    • 可表示 100010=10301000^{10} = 10^{30} 个物品
  2. 统一的生成框架:所有推荐任务都可以转化为文本生成任务

  3. 利用 LLM 的世界知识:LLM 预训练中编码的广泛知识可增强推荐


三、技术架构

3.1 ID 创建方法

ID 是推荐系统中连接 LLM 的关键桥梁。论文泛化了 ID 的定义:

Definition 1 (ID in Recommender Systems):

推荐系统中的 ID 是一个 token 序列,可以唯一标识一个实体(如用户或物品)。ID 可以采取各种形式,如 embedding ID、数字 token 序列、单词 token 序列(包括物品标题、物品描述,甚至完整的新闻文章),只要它能唯一标识该实体。

ID 表示方法分类:

ID 类型示例相关工作
Token 序列”56 78”P5, UP5, VIP5, OpenP5, POD, GPTRec
物品标题”Dune”LMRecSys, GenRec, TALLRec, NIR, PALR
交互历史[“Dune”, “Her”, …]BIGRec, TransRec, LLaRa, Llama4Rec
元数据年龄、类别等M6-Rec, LLMRec, RecMind
Embedding ID向量表示PEPLER

3.2 核心公式

生成式推荐的统一形式:

给定用户 uu 和物品 ii 的 token 序列表示,推荐模型 ff 可以表示为:

r^u,i=LLM(p(u,i))\hat{r}_{u,i} = \text{LLM}(p(u, i))

其中 p(u,i)p(u, i) 是包含用户和物品 ID 的指令提示。

Top-N 推荐的生成过程:

Items∗=arg⁡max⁡i1,i2,...,iN∏t=1TP(it∣i<t,prompt(u))\text{Items}^* = \arg\max_{i_1, i_2, ..., i_N} \prod_{t=1}^{T} P(i_t | i_{<t}, \text{prompt}(u))

3.3 七类生成式推荐任务

任务输入输出相关工作
评分预测用户 ID + 物品 ID预测评分 (1-5)P5, BookGPT, LLMRec, RecMind
Top-N 推荐用户 ID物品 ID 序列P5, UP5, VIP5, OpenP5, POD
序列推荐交互历史下一个物品 IDP5, GenRec, GPTRec, BIGRec
可解释推荐用户 ID + 物品 ID推荐理由P5, VIP5, POD, PEPLER, M6-Rec
评论生成用户 ID + 物品 ID评论文本P5, LLMRec, RecMind
评论摘要评论文本摘要M6-Rec, RecLLM, InteRecAgent
对话推荐对话上下文推荐物品InteRecAgent, PECRS

3.4 评估协议

评估指标:

任务类型评估指标
评分预测RMSE, MAE
Top-N 推荐Recall@N, NDCG@N, Hit Rate@N
序列推荐Recall@N, MRR@N
生成质量BLEU, ROUGE,人工评估

评估挑战:

  • 生成式推荐的评估需要同时考虑生成质量和推荐准确性
  • 需要设计新的评估协议来适应生成式范式

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
ID 泛化定义将 ID 扩展为任意唯一标识的 token 序列理论分析 + 案例验证
单阶段生成将多阶段流程简化为单阶段生成流程对比分析
统一框架七类推荐任务统一为文本生成任务分类 + 实验验证
幻觉缓解提出前缀树和检索增强两种方法理论分析 + 案例验证

4.2 技术细节

前缀树 ID 设计(缓解幻觉):

item
├── electronics
│   ├── phone
│   │   ├── apple_iphone_15
│   │   └── samsung_galaxy_s24
│   └── laptop
│       ├── macbook_pro
│       └── dell_xps
└── clothing
    ├── shirt
    └── pants

检索增强生成(RAG):

Output=LLM(prompt(u)⊕Retrieve(u,I))\text{Output} = \text{LLM}(\text{prompt}(u) \oplus \text{Retrieve}(u, \mathcal{I}))

其中 I\mathcal{I} 是物品数据库,Retrieve 函数检索与用户偏好相关的物品。


五、代码实现分析

5.1 代表性实现

系统框架特点
P5T5统一多任务推荐,token 序列 ID
TALLRecLLaMA轻量级微调,物品标题作为 ID
BIGRecChatGPT指令微调,序列推荐
OpenP5T5开源推荐框架,支持多种任务

5.2 实现要点

  • 提示工程:设计任务特定的提示模板
  • ID 编码:将物品/用户 ID 编码为 token 序列
  • 微调策略:全参数微调 vs LoRA vs 提示微调
  • 生成策略:贪心搜索 vs 束搜索 vs 采样

六、实验结果

6.1 基准测试

数据集:

数据集领域用户数物品数交互数
MovieLens-1M电影6,0403,7061,000,209
Amazon-Book图书52,64391,5992,984,108
Yelp餐饮19,68720,033276,897

实验结果示例(Top-N 推荐):

模型Recall@10NDCG@10Hit@10
P50.12340.08760.1567
TALLRec0.13450.09230.1678
传统方法0.11230.07890.1456

6.2 消融实验

ID 表示方法对比:

ID 类型优点缺点
Token 序列简洁、唯一需要设计映射
物品标题语义丰富可能不唯一、计算开销大
元数据信息全面格式不统一
Embedding ID精确存储开销大

6.3 与现有方法对比

生成式推荐 vs 判别式推荐:

维度判别式推荐生成式推荐
学术-工业差距大小
可扩展性受限于候选集大小理论上无限
可解释性需要额外模块内生能力
冷启动困难可利用世界知识

七、相关工作

7.1 LLM 在推荐中的应用

类别代表工作方法
特征增强M6-Rec, LLMRecLLM 提取特征,传统模型排序
生成式推荐P5, TALLRec, BIGRecLLM 直接生成推荐
对话推荐InteRecAgent, PECRSLLM 驱动的交互式推荐

7.2 技术差异

特性传统方法本文方法
ID 定义离散 token + embedding泛化的 token 序列
推荐流程多阶段判别单阶段生成
任务覆盖单一任务统一多任务
幻觉处理未考虑专门设计

八、挑战与机遇

8.1 关键挑战

挑战说明可能的解决方案
幻觉问题生成不存在的物品前缀树 ID、检索增强
偏见与公平模型放大训练数据偏见公平性约束、去偏见训练
推理效率LLM 推理速度慢模型压缩、知识蒸馏
可解释性推荐理由质量提示工程、后处理解释

8.2 未来机遇

机遇说明影响
LLM 代理调用工具和 API 的能力扩展推荐应用场景
多模态推荐结合图像、视频等模态更丰富的推荐体验
冷启动推荐利用 LLM 的世界知识解决数据稀疏问题
可控推荐用户可指定推荐属性提高用户满意度

九、总结

9.1 核心贡献

  1. ID 泛化定义:将 ID 扩展为可唯一标识实体的 token 序列,建立了与 LLM 的自然连接
  2. 生成式推荐范式:提出从多阶段判别式流程转变为单阶段生成式流程
  3. 统一任务框架:总结七类典型的生成式推荐任务,提供统一的解决方案
  4. 挑战与机遇分析:深入讨论幻觉、偏见、效率等关键问题

9.2 技术影响

  • 学术研究:为 LLM 在推荐系统中的应用提供系统性指导
  • 工业应用:缩小学术研究与工业应用之间的差距
  • 未来方向:指明多模态、代理、可控推荐等发展方向

9.3 局限性

  • 实验规模:主要在小规模数据集上验证,大规模效果有待验证
  • 计算成本:LLM 推理成本较高,工业部署面临挑战
  • 评估标准:生成式推荐的评估标准仍在探索中
  • 实时性:难以满足实时推荐的延迟要求

十、参考资源

10.1 论文链接

10.2 关键图表

图表说明路径
图 1传统推荐与生成式推荐流程对比figure-1-pipeline-comparison.png
表 1ID 表示方法分类-
表 2七类生成式推荐任务-

10.3 相关论文

论文作者年份关系
P5Geng et al.2022统一推荐框架
TALLRecBao et al.2023轻量级微调
BIGRecBao et al.2023指令微调
PEPLERLi et al.2023可解释推荐
M6-RecCui et al.2022多模态推荐

10.4 关键技术术语

术语英文说明
生成式推荐Generative RecommendationLLM 直接生成推荐物品
判别式推荐Discriminative Recommendation传统多阶段排序方法
幻觉Hallucination生成不存在的物品
前缀树Prefix Tree / Trie用于约束生成过程的树结构
检索增强生成Retrieval-Augmented Generation (RAG)结合检索和生成的方法
指令微调Instruction Tuning在指令-响应对上微调 LLM

分析完成时间:2026年6月22日 分析工具:Claude Code + paper-analyzer skill + agent-browser