Back to blog

Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation

基于多模态大语言模型的级联系统,用于工业级视频内容审核,通过路由器-排序器架构降低计算成本

Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation

论文信息: arXiv:2507.17204 [cs.LG] 23 Jul 2025

机构: 字节跳动 (ByteDance Inc.)

模型规模: Mistral-7B + ViT-Large


一、论文概述

1.1 研究背景

短视频平台(YouTube Shorts、Instagram Reels)的快速发展使内容审核变得至关重要。传统视频分类模型在处理复杂场景(如隐含有害内容和上下文歧义)时存在局限性。

核心挑战:

挑战说明
计算成本MLLM 部署成本高昂,无法直接全量部署
模型适配生成式模型难以直接用于判别式分类任务
数据需求传统方法需要大量标注数据
实时性工业级系统需要低延迟处理海量视频

1.2 核心贡献

贡献说明
路由器-排序器级联系统轻量级路由器过滤 + MLLM 精细排序
生成式到判别式转换将生成式 MLLM 转换为多模态分类器
最小化微调数据仅需 2% 的标注数据即可达到优异性能
工业级部署验证在真实生产环境中验证系统效果

1.3 一句话总结

Filter-And-Refine 是一个基于 MLLM 的级联视频内容审核系统,通过路由器-排序器架构实现工业级部署,F1 分数提升 66.50%,计算成本仅为直接部署的 1.5%。


二、核心思想

2.1 设计原则

┌─────────────────────────────────────────────────────────────────┐
│                    Filter-And-Refine 设计原则                    │
├─────────────────────────────────────────────────────────────────┤
│  1. 级联架构 (Cascade Architecture)                              │
│     • 轻量级路由器:快速过滤低风险内容                            │
│     • MLLM 排序器:精细分析高风险内容                            │
│     • 降低计算成本,提高处理效率                                  │
│                                                                 │
│  2. 模型适配 (Model Adaptation)                                  │
│     • 将生成式 MLLM 转换为判别式分类器                           │
│     • 最小化微调数据需求                                        │
│     • 保持 MLLM 的推理能力                                      │
└─────────────────────────────────────────────────────────────────┘

2.2 关键技术问题

问题现有方案的局限Filter-And-Refine 解决方案
计算成本直接部署 MLLM 成本过高级联架构,路由器过滤 97.5% 流量
模型适配生成式模型不适合分类任务最小化微调,将生成式转换为判别式
数据需求传统方法需要大量标注数据仅需 2% 的标注数据
实时性MLLM 推理延迟高路由器无延迟,排序器仅处理高风险内容

三、技术架构

3.1 整体架构

级联系统架构 图 1:级联系统设计概览。系统由两个阶段组成:路由器和排序器。路由器过滤并选择潜在高风险内容,排序器进行精细分类以优化最终决策。

核心组件:

组件说明关键特性
路由器 (Router)轻量级第一阶段过滤器基于嵌入检索,无监督学习
排序器 (Ranker)MLLM 第二阶段精细分析Mistral-7B + ViT-Large
种子库 (Seed Bank)高风险代表性视频库支持快速适应和灵活调整

3.2 路由器设计

路由器采用嵌入检索系统作为第一阶段过滤器:

工作原理:

  1. 维护一个高风险代表性视频库(种子视频)
  2. 新发布视频基于语义相似性与种子视频进行匹配
  3. 选择高风险候选内容进入排序器

种子选择策略:

  • 质心近邻种子选择:使用聚类算法识别高质量种子
  • 人工种子选择:依赖标注员识别”黄金种子”

优势:

  • 无需标注数据,无监督训练
  • 种子库架构支持快速适应
  • 高召回率,过滤 97.5% 低风险内容

3.3 排序器设计

排序器基于 LLaVA 架构:

组件说明关键参数
LLMMistral-7B兼容工业部署环境
视觉编码器ViT-Large鲁棒的视觉特征提取
投影器两层 MLP对齐视觉和语言表示

训练目标:

  • 标准下一个 token 预测(用于 VQA 数据集)
  • 单 token 预测(用于分类任务)

3.4 输出转换算法

将 MLLM 输出转换为概率分数:

算法 1:修改输出伪代码

输入:提示词 P, 模型 M, 分词器 T
输出:分数 S = [p_Y, p_N]

步骤 1:模型推理
  input_ids ← T.tokenize(P)
  output_ids ← M.generate(input_ids)
  logits ← output_ids.scores

步骤 2:计算答案概率
  ℓ_Y ← logits[Y]
  ℓ_N ← logits[N]

  计算 softmax 概率:
  p_Y ← e^ℓ_Y / (e^ℓ_Y + e^ℓ_N)
  p_N ← e^ℓ_N / (e^ℓ_Y + e^ℓ_N)

步骤 3:生成输出分数
  S ← [p_Y, p_N]  {最终概率列表}

返回 S

四、训练策略

4.1 训练数据

三部分数据集(总计约 300k 样本,1:1:1 比例):

数据集说明用途
VQA 数据集LLaVA-Mix665k 子集视觉理解基础
视频描述数据集高质量视频描述提供丰富上下文摘要
分类数据集内容审核任务标签细粒度问题标签和整体标签

4.2 训练策略对比

两种 SFT 策略:

策略说明训练时间优势
多任务学习直接混合 D1, D2, D3 训练20 小时 (8×A100)性能稳定
混合序列阶段学习第一阶段:视觉指令调优;第二阶段:审核导向 SFT10 + 10.5 小时 (8×A100)时间效率高

4.3 提示词设计

提示词模板 图 2:四种提示词模板示意图

模板说明PR-AUC
P1直接询问整体标签66.96
P2分别询问细粒度标签和整体标签68.10
P3顺序询问细粒度和整体标签,强调关系62.43
P4提供细粒度问题定义,分别询问两个问题66.97

五、核心创新

5.1 创新点总结

创新点说明理论/实验依据
路由器-排序器级联轻量级过滤 + MLLM 精细分析计算成本降至 1.5%
生成式到判别式转换将 MLLM 转换为多模态分类器F1 提升 66.50%
最小化微调数据仅需 2% 的标注数据与全量数据性能相当
嵌入检索路由器无监督种子选择,高召回率过滤 97.5% 流量

5.2 技术亮点

1. 级联架构设计:

  • 路由器:嵌入检索,无监督学习,高召回率
  • 排序器:MLLM 精细分析,高精度
  • 整体:计算成本降低 98.5%

2. 模型适配方法:

  • 单 token 输出(Yes/No)模拟分类
  • softmax 转换为概率分数
  • 支持阈值调整优化模型行为

3. 最小化数据需求:

  • 传统方法需要大量标注数据
  • 本方法仅需 2% 的标注数据
  • 节省大量人工标注成本

六、实验结果

6.1 离线评估结果

模型架构对比:

模型提示词PR-AUC (%)ROC-AUC (%)Max-F1 (%)
X-VLM-30.7965.3136.81
LLaVA-23.1758.5931.32
LLaVA w/ Caption-28.8565.8836.71
混合序列阶段学习P268.1087.4760.98
多任务学习P268.7387.6861.29

关键发现:

  • 模型架构:MLLM 在 F1 分数上显著超越传统多模态分类模型 66.50%
  • 监督微调:微调后的 MLLM 在 PR-AUC 上超越零样本模型 45.55%
  • 训练策略:多任务学习模型在所有提示词上表现更稳定

6.2 消融实验

标签组装方法对比:

方法PR-AUC (%)ROC-AUC (%)Max-F1 (%)
原始68.7387.6861.29
联合概率68.7887.8361.28
最大概率68.7987.7861.29
加权和概率68.8387.7861.28
贝叶斯融合68.6787.7961.22

温度调优:

  • 温度范围 0.2-0.8 对模型性能影响不大

6.3 在线实验结果

A/B 实验结果(12 个代表性问题):

指标结果
自动审核量提升+41.27%
系统精度提升+19.16%
路由器过滤流量97.5%
计算成本仅为直接部署的 1.5%
标注数据使用仅需传统方法的 2%

6.4 可视化分析

嵌入可视化 图 3:从每个模型的最后一层隐藏层提取的嵌入可视化

关键发现:

  • LLaVA 原始模型:决策边界模糊
  • LLaVA w/ Caption:决策边界有所改善
  • 最佳微调模型:清晰的决策边界

七、应用场景

7.1 视频内容审核

  • 有害内容检测:暴力、色情、仇恨言论等
  • 隐含违规识别:微妙形式的虚假信息或暗示性图像
  • 上下文理解:理解视频内容的上下文含义

7.2 工业级部署

  • 高流量处理:每日数亿新视频上传
  • 实时审核:低延迟处理海量视频
  • 成本控制:计算成本降至直接部署的 1.5%

7.3 灵活适应

  • 快速调整:通过修改种子库快速适应新违规类型
  • 提示词工程:无需重新训练即可适应不同审核任务
  • 阈值调整:通过调整阈值优化模型行为

八、相关工作

8.1 基于 ML 的内容审核

方法特点局限性
传统视频分类处理明确定义的审核任务难以处理复杂场景
MLLM 零样本无需微调即可使用性能有限
MLLM 微调本方法需要一定标注数据

8.2 MLLM 与监督微调

方法特点局限性
LLaVA强大的多模态理解生成式模型不适合分类
X-VLM传统多模态分类性能有限
本方法生成式到判别式转换需要微调数据

九、总结

9.1 核心贡献

  1. 路由器-排序器级联系统:实现工业级 MLLM 部署
  2. 生成式到判别式转换:将 MLLM 转换为多模态分类器
  3. 最小化微调数据:仅需 2% 的标注数据
  4. 工业级验证:在真实生产环境中验证系统效果

9.2 技术影响

影响领域具体影响
内容审核推动 MLLM 在内容审核中的应用
模型部署提供工业级 MLLM 部署方案
数据效率展示最小化数据需求的微调方法
成本控制显著降低计算成本

9.3 局限性

  • 模型规模:Mistral-7B 仍有一定计算开销
  • 提示词敏感:不同提示词性能差异较大
  • 温度不敏感:温度调优对性能影响有限
  • 数据依赖:仍需要一定数量的标注数据

9.4 未来方向

  1. 模型压缩:进一步减小模型规模
  2. 更多任务:扩展到更多内容审核任务
  3. 实时优化:进一步降低推理延迟
  4. 主动学习:减少标注数据需求

十、参考资源

10.1 论文链接

10.2 关键图表

图表说明路径
图 1级联系统架构figure-1-cascade-system.png
图 2提示词模板figure-2-prompt-templates.png
图 3嵌入可视化figure-3-embedding-visualization.png

10.3 相关论文

论文作者年份关系
LLaVALiu et al.2024模型架构基础
Mistral-7BJiang et al.2023LLM 骨干
X-VLMZeng et al.2022传统分类基线

10.4 关键技术术语

术语英文说明
级联系统Cascade System两阶段过滤-排序架构
路由器Router第一阶段轻量级过滤器
排序器Ranker第二阶段 MLLM 精细分析
嵌入检索Embedding Retrieval基于语义相似性的检索
生成式到判别式Generative to Discriminative将生成模型转换为分类器

分析完成时间:2026年6月17日 分析工具:Claude Code + agent-browser