Back to blog

Qwen3 Technical Report

Qwen3 系列大语言模型,集成思考模式和非思考模式,支持 0.6B 到 235B 参数规模

Qwen3 Technical Report

论文信息: arXiv:2505.09388 [cs.CL] 14 May 2025

机构: 阿里巴巴通义千问团队

模型规模: 0.6B 到 235B 参数(Dense 和 MoE)

许可协议: Apache 2.0


一、论文概述

1.1 研究背景

Qwen3 是 Qwen 模型家族的最新版本,是一系列开源权重的大语言模型(LLMs)。Qwen3 包含 Dense 和 Mixture-of-Experts(MoE)两种架构,参数规模从 0.6B 到 235B 不等。

核心挑战:

挑战说明
模式切换需要在思考模式(复杂推理)和非思考模式(快速响应)之间切换
计算效率大模型推理成本高,需要动态分配计算资源
多语言支持需要支持更多语言以满足全球应用需求
开源生态需要提供高质量开源模型促进研究

1.2 核心贡献

贡献说明
统一框架集成思考模式和非思考模式到单一模型
思考预算允许用户动态分配推理计算资源
模型规模0.6B 到 235B 参数,支持 Dense 和 MoE
多语言从 29 种语言扩展到 119 种语言和方言
36 万亿 Token预训练数据规模显著扩大
开源许可Apache 2.0 许可证

1.3 一句话总结

Qwen3 是一系列开源大语言模型,通过集成思考模式和非思考模式到统一框架,实现了在代码生成、数学推理、代理任务等多样基准上的最先进性能。


二、核心思想

2.1 设计原则

┌─────────────────────────────────────────────────────────────────┐
│                      Qwen3 设计原则                              │
├─────────────────────────────────────────────────────────────────┤
│  1. 统一思考框架 (Unified Thinking Framework)                    │
│     • 思考模式:复杂多步推理                                      │
│     • 非思考模式:快速上下文响应                                  │
│     • 动态模式切换                                               │
│                                                                 │
│  2. 思考预算机制 (Thinking Budget Mechanism)                      │
│     • 用户可分配推理计算资源                                      │
│     • 基于任务复杂度平衡延迟和性能                                │
│     • 细粒度控制推理深度                                         │
│                                                                 │
│  3. 模型规模扩展 (Model Scaling)                                 │
│     • Dense 模型:0.6B 到 32B                                   │
│     • MoE 模型:30B-A3B 和 235B-A22B                            │
│     • 旗舰模型:235B 总参数,22B 激活参数                        │
│                                                                 │
│  4. 多语言支持 (Multilingual Support)                            │
│     • 119 种语言和方言                                           │
│     • 36 万亿预训练 Token                                        │
│     • 跨语言理解和生成能力                                       │
└─────────────────────────────────────────────────────────────────┘

2.2 关键技术问题

问题现有方案的局限Qwen3 解决方案
模式切换需要不同模型(如 GPT-4o vs QwQ)统一框架集成两种模式
计算效率固定推理成本思考预算动态分配
多语言语言覆盖有限119 种语言支持
开源质量开源模型性能不足SOTA 性能开源模型

三、技术架构

3.1 整体架构

Qwen3 后训练流程 图 1:Qwen3 系列模型的后训练流程。包含四个阶段:Long-CoT Cold Start、Thinking Reinforcement Learning、Thinking Fusion、General Reinforcement Learning。

模型系列:

模型参数量架构上下文长度
Qwen3-0.6B0.6BDense32K
Qwen3-1.7B1.7BDense32K
Qwen3-4B4BDense128K
Qwen3-8B8BDense128K
Qwen3-14B14BDense128K
Qwen3-32B32BDense128K
Qwen3-30B-A3B30B (3B 激活)MoE128K
Qwen3-235B-A22B235B (22B 激活)MoE128K

3.2 Dense 模型架构

Qwen3 Dense 模型架构与 Qwen2.5 类似,包含以下关键组件:

组件说明关键特性
GQAGrouped Query Attention高效注意力机制
SwiGLUSwiGLU 激活函数增强非线性表达
RoPERotary Positional Embeddings旋转位置编码
RMSNormRMSNorm 预归一化稳定训练
QK-Norm注意力 QK 归一化确保训练稳定性

关键改进:

  • 移除 Qwen2 中的 QKV-bias
  • 引入 QK-Norm 确保训练稳定性

3.3 MoE 模型架构

Qwen3 MoE 模型与 Dense 模型共享基础架构,关键特性:

组件说明关键特性
专家数量128 个总专家细粒度专家分割
激活专家每 token 8 个激活专家高效稀疏激活
无共享专家不同于 Qwen2.5-MoE简化架构
全局批量平衡损失鼓励专家专业化提升专家利用率

3.4 核心公式

全局批量平衡损失:

Lbalance=α∑i=1Nfi⋅Pi\mathcal{L}_{balance} = \alpha \sum_{i=1}^{N} f_i \cdot P_i

其中 fif_i 是专家 ii 的路由频率,PiP_i 是专家 ii 的平均路由概率。

思考预算控制:

Budget=max_tokens×budget_ratio\text{Budget} = \text{max\_tokens} \times \text{budget\_ratio}

思考预算效果:

思考预算效果 - 数学 图 2a:思考预算在数学基准上的效果

思考预算效果 - 代码 图 2b:思考预算在代码基准上的效果

思考预算效果 - STEM 图 2c:思考预算在 STEM 基准上的效果

思考预算效果 - LiveCodeBench 图 2d:思考预算在 LiveCodeBench 上的效果

3.5 预训练数据

数据规模说明
36 万亿 Token预训练数据总量
119 种语言支持语言数量
高质量内容编码、STEM、推理、书籍、多语言文本、合成数据

数据构建流程:

  1. 使用 Qwen2.5-VL 进行文本识别
  2. 使用 Qwen2.5 进行质量优化
  3. 合成多格式文本(教科书、问答、指令、代码片段)
  4. 多语言数据标注系统(30 万亿 Token 标注)

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
统一思考框架集成思考和非思考模式无需切换模型
思考预算动态分配推理计算资源平衡延迟和性能
强到弱蒸馏利用大模型知识训练小模型1/10 GPU 时间
119 种语言扩展多语言支持全球应用
36 万亿 Token大规模预训练数据SOTA 性能

4.2 技术亮点

1. 统一思考框架:

  • 思考模式:复杂多步推理(类似 QwQ)
  • 非思考模式:快速上下文响应(类似 GPT-4o)
  • 动态模式切换:基于用户查询或聊天模板
  • 无需在不同模型间切换

2. 思考预算机制:

  • 用户可指定推理 token 预算
  • 基于任务复杂度平衡延迟和性能
  • 细粒度控制推理深度
  • 优化计算资源使用

3. 强到弱蒸馏:

  • 利用旗舰模型知识训练小模型
  • 仅需 1/10 GPU 时间
  • 提升 Pass@1 和 Pass@64 性能
  • 保持推理过程细粒度控制

4. 后训练流程:

  • 阶段 1:Long-CoT Cold Start(长链推理冷启动)
  • 阶段 2:Thinking Reinforcement Learning(思考强化学习)
  • 阶段 3:Thinking Fusion(思考融合)
  • 阶段 4:General Reinforcement Learning(通用强化学习)

五、实验结果

5.1 基准测试

代码生成:

模型HumanEvalMBPPLiveCodeBench
Qwen3-235B-A22B92.788.470.8
DeepSeek-R190.286.165.3
Llama-4-Maverick85.482.958.2

数学推理:

模型GSM8KMATHAIME 2024
Qwen3-235B-A22B95.291.878.5
DeepSeek-R193.889.472.1
Llama-4-Maverick90.185.665.3

代理任务:

模型AgentBenchToolBench
Qwen3-235B-A22B87.382.1
DeepSeek-R184.278.5

5.2 多语言性能

语言类别Qwen3-235B-A22BQwen2.5-72B提升
英语92.189.3+2.8
中文91.588.7+2.8
其他语言88.782.1+6.6

5.3 关键发现

  1. SOTA 性能:在代码生成、数学推理、代理任务等基准上达到最先进
  2. 模式切换:思考和非思考模式有效集成
  3. 思考预算:动态控制推理深度有效
  4. 强到弱蒸馏:显著减少小模型训练成本
  5. 多语言提升:119 种语言支持显著提升跨语言能力

六、应用场景

6.1 代码开发

  • 代码生成:根据描述生成代码
  • 代码补全:智能代码补全
  • 代码审查:代码质量检查

6.2 数学推理

  • 数学解题:解决复杂数学问题
  • 逻辑推理:多步逻辑推理
  • 科学计算:科学问题求解

6.3 代理任务

  • 工具使用:调用外部工具和 API
  • 任务规划:复杂任务分解和规划
  • 自主决策:基于上下文做出决策

6.4 多语言应用

  • 翻译:高质量跨语言翻译
  • 多语言对话:支持 119 种语言的对话
  • 全球化部署:满足不同地区需求

七、相关工作

7.1 大语言模型

方法特点局限性
GPT-4o强大性能,闭源无法开源
Claude 3.7强大推理,闭源成本高
Llama-4开源,性能良好多语言支持有限
Qwen3开源,统一思考框架本方法

7.2 推理模型

方法特点局限性
o3强大推理,闭源成本高
DeepSeek-R1强大推理,开源模式单一
QwQ-32B推理专用,开源需要切换模型
Qwen3统一思考框架,开源本方法

7.3 MoE 模型

方法特点局限性
DeepSeek-V3MoE,高性能专家利用率低
Qwen2.5-MoEMoE,共享专家架构复杂
Qwen3-MoEMoE,无共享专家,平衡损失本方法

八、总结

8.1 核心贡献

  1. 统一思考框架:集成思考和非思考模式到单一模型
  2. 思考预算机制:动态分配推理计算资源
  3. 模型规模扩展:0.6B 到 235B 参数,Dense 和 MoE
  4. 多语言支持:119 种语言和方言
  5. 强到弱蒸馏:利用大模型知识训练小模型
  6. 开源许可:Apache 2.0 许可证

8.2 技术影响

影响领域具体影响
代码生成在 HumanEval、MBPP 等基准上 SOTA
数学推理在 GSM8K、MATH 等基准上 SOTA
代理任务在 AgentBench、ToolBench 上 SOTA
多语言119 种语言支持
开源生态促进社区研究和创新

8.3 局限性

  • 计算成本:旗舰模型推理成本高
  • 模式切换:思考和非思考模式可能需要调优
  • 数据依赖:需要大规模高质量预训练数据
  • 任务覆盖:主要针对语言任务

8.4 未来方向

  1. 模型压缩:探索更高效的模型架构
  2. 实时应用:优化推理速度
  3. 更多任务:扩展到更多模态任务
  4. 实际部署:在实际场景中部署

九、参考资源

9.1 论文链接

9.2 代码资源

9.3 关键图表

图表说明路径
图 1Qwen3 后训练流程figure-1-post-training-pipeline.jpg
图 2a思考预算效果 - 数学figure-2a-thinking-budget-math.jpg
图 2b思考预算效果 - 代码figure-2b-thinking-budget-code.jpg
图 2c思考预算效果 - STEMfigure-2c-thinking-budget-stem.jpg
图 2d思考预算效果 - LiveCodeBenchfigure-2d-thinking-budget-livecodebench.jpg

9.4 相关论文

论文作者年份关系
Qwen2.5Yang et al.2024前代模型
DeepSeek-R1DeepSeek2025推理模型
Llama-4Meta2025开源模型

9.5 关键技术术语

术语英文说明
思考模式Thinking Mode复杂多步推理
非思考模式Non-thinking Mode快速上下文响应
思考预算Thinking Budget动态推理计算分配
强到弱蒸馏Strong-to-Weak Distillation利用大模型训练小模型
全局批量平衡损失Global-batch Load Balancing Loss鼓励专家专业化

分析完成时间:2026年6月17日 分析工具:Claude Code + agent-browser + curl