Back to blog

Fish Audio S2 Technical Report

开源可控文本到语音系统,支持多说话人、多轮对话和自然语言指令控制

Fish Audio S2 Technical Report

一、论文概述

项目内容
标题Fish Audio S2 Technical Report
作者Shijia Liao, Yuxuan Wang, Songting Liu, Yifan Cheng, Ruoyi Zhang, Tianyu Li, Shidong Li, Yisheng Zheng, Xingwei Liu, Qingzheng Wang, Zhizhuo Zhou, Jiahua Liu, Xin Chen, Dawei Han
机构Fish Audio
论文arXiv:2603.08823
代码GitHub
模型HuggingFace
演示fish.audio
发布2026年3月
许可CC BY 4.0
硬件平台NVIDIA H200 GPU(推理)

二、核心思想

问题定义

高质量、可控的文本到语音(TTS)系统在现代 AI 应用中至关重要,包括有声书朗读、视频配音和个性化聊天机器人等场景。当前 TTS 系统面临以下关键挑战:

  • 指令跟随能力不足: 难以通过自然语言描述精细控制语音生成的韵律、情感和说话风格
  • 数据标注瓶颈: 为大规模语音数据生成细粒度自然语言指令仍然是主要瓶颈
  • 分布偏移问题: 预训练过滤模型与 RL 奖励信号之间的分布不匹配导致训练效果不佳
  • 多说话人多轮对话: 现有系统难以在单次生成中处理多个说话人的交错对话

解决方案概述

Fish Audio S2 是一个开源 TTS 系统,基于 Fish Audio S1 的 decoder-only Transformer 骨干和 RVQ 音频编解码器,通过以下核心创新实现突破:

  1. Dual-AR 架构: 解耦时间语义建模和深度声学建模
  2. 多用途数据管道: 语音质量模型和富转录 ASR 模型同时用于预训练过滤和 RL 奖励信号
  3. 多维度 RL 对齐: 基于 GRPO 的多奖励强化学习,联合优化语义准确性、声学质量和说话人相似度

核心性能

  • RTF: 0.195(实时因子)
  • TTFA: <100 ms(首音时间)
  • 吞吐量: 3000+ 声学 tokens/秒
  • WER: 中文 0.54%,英文 0.99%(Seed-TTS-Eval)
  • 支持语言: 80+ 种语言和方言

三、技术架构

整体框架

架构图

Figure 2: Fish Audio S2 架构

Audio Tokenizer

基于 Descript Audio Codec (DAC) 架构,针对高保真实时流式传输优化:

RVQ 策略:

  • 采样率: 44.1 kHz
  • 码本数量: N=10
  • 第一个码本: 语义码本
  • 剩余 9 个码本: 捕获渐进式细粒度声学细节

流式架构:

  • 因果卷积: 使用掩码因果卷积替代标准卷积,确保严格因果性
  • Transformer 瓶颈: 在 RVQ 层前后集成因果滑动窗口 Transformer 块
  • 扩展下采样: 标准 DAC 编码器 (512x) + ConvNeXt V2 层 (4x) = 总下采样比 2048,帧率约 21 Hz
  • EVA-GAN 解码器: 使用 EVA-GAN 结构替代原始 DAC 解码器

语义蒸馏:

  • 辅助语义预测头联合优化,回归预训练 w2v-BERT 2.0 模型的第 16 层激活
  • 确保第一个码本捕获丰富的语言和语音信息

模型参数: 446M 参数,训练约 1M 步

Dual-Autoregressive 生成

数据管道

Figure 3: Fish Audio S2 数据管道

为解决直接展平 10 层 RVQ 码本的维度挑战,采用 Dual-AR 架构解耦时间语义建模和深度声学建模:

Slow AR(慢自回归):

  • 骨干网络: 预训练 Qwen3-4B
  • 操作: 在完整 token 序列上自回归
  • 输出: 每个时间步 t 预测第一个 RVQ 码本的语义 token qt(0)q_t^{(0)}

Fast AR(快自回归):

  • 结构: 4 层 Transformer,独立权重和嵌入表
  • 输入: Slow AR 生成的语义 token
  • 输出: 重建剩余的细粒度声学细节

Multi-Codebook Fusion (MCF):

  • 在时间步 t 的所有 N 个码本 token 生成后
  • 聚合为单个连续向量 xt+1x_{t+1}
  • 作为 Slow AR 在时间步 t+1 的输入嵌入

核心公式

RVQ 量化: qt(n)=arg⁡min⁡q∈C(n)∥zt(n)−q∥2q_t^{(n)} = \arg\min_{q \in \mathcal{C}^{(n)}} \|z_t^{(n)} - q\|^2

其中 zt(n)z_t^{(n)} 是第 n 层残差,C(n)\mathcal{C}^{(n)} 是第 n 个码本。

Dual-AR 生成: p(qt(0)∣q<t(0))=SlowAR(q<t(0))p(q_t^{(0)} | q_{<t}^{(0)}) = \text{SlowAR}(q_{<t}^{(0)}) p(qt(n)∣qt(0),qt(<n))=FastAR(qt(0),qt(<n)),n=1,…,N−1p(q_t^{(n)} | q_t^{(0)}, q_t^{(<n)}) = \text{FastAR}(q_t^{(0)}, q_t^{(<n)}), \quad n = 1, \ldots, N-1

Multi-Codebook Fusion: xt+1=MCF(qt(0),qt(1),…,qt(N−1))x_{t+1} = \text{MCF}(q_t^{(0)}, q_t^{(1)}, \ldots, q_t^{(N-1)})

四、数据管道

三阶段数据整理

多说话人控制

Figure 4: Fish Audio S2 支持细粒度自然语言控制的多说话人生成

阶段 1: 源分离和分段

  • 人声分离模块从背景噪声中隔离干净语音
  • 语音活动检测 (VAD) 将连续音频切分为话语级片段

阶段 2: 质量过滤

  • 语音质量模型评估每个话语的多个维度
  • 过滤低保真样本

阶段 3: 富转录

  • 内部 ASR 模型生成高度准确的转录
  • 包含说话人轮换和语音事件标注

语音质量模型

  • 架构: 基于 Uni-VERSA 设计
  • 骨干: 预训练 w2v-BERT 2.0
  • 头部: MLP 用于声学评估

富转录 ASR 模型

  • 基础模型: 微调 Qwen3-Omni-30B-A3B
  • 功能: 联合转录语音内容、标注说话人轮换和语音事件
  • 输出: 预测说话人轮换(如 <|speaker:0|>)并注入语音指令(如 [prolonged laugh], [inhale], [angry], [emphasis], [in a hurry])

五、训练流程

四阶段训练

阶段 1: Audio Tokenizer 训练

  • 参数: 446M
  • 步数: ~1M 步
  • 损失: 复合 GAN 损失框架,包含三个判别器

阶段 2: 预训练

  • 对齐音频 token 与 Qwen3-4B 基础模型
  • 两个渐进阶段
  • 数据: 超过 1000 万小时原始音频,约 80 种语言和方言
  • Token: 超过 5000 亿 tokens
  • 词表扩展: 结构控制 token + 4096 语义 token

阶段 3: SFT

  • 在内部策划的高质量标注数据上微调

阶段 4: RL 后训练

RL 训练曲线

Figure 5: RL 后训练期间的训练奖励曲线

基于 GRPO 和 Dr.GRPO 的 RL 算法,目标是缓解幻觉、token 跳过和音色漂移。

多维度奖励系统:

奖励模型功能
R_STT(语义准确性)ASR 转录模型token 加权掩码用于说话人 ID 标签和语音指令
R_Pref(声学偏好)语音质量模型评估声学质量
R_SIM(音色相似度)声纹模型提取特征计算余弦相似度

关键创新: 数据管道中的语音质量模型和富转录 ASR 模型直接复用为 RL 奖励信号,消除两个阶段之间的分布偏移。

六、推理引擎

基于 SGLang 构建的生产级推理引擎:

特性:

  • 连续批处理 (Continuous Batching)
  • 分页 KV 缓存 (Paged KV Cache)
  • CUDA 图重放 (CUDA Graph Replay)
  • RadixAttention 高效前缀缓存

性能(NVIDIA H200 GPU):

指标数值
实时因子 (RTF)0.195
首音时间 (TTFA)<100 ms
吞吐量3000+ 声学 tokens/秒

七、核心创新

创新点说明理论/实验依据
Dual-AR 架构解耦时间语义建模和深度声学建模Slow AR (Qwen3-4B) + Fast AR (4层Transformer)
多用途数据管道同一模型用于预训练过滤和 RL 奖励消除分布偏移
多维度 RL 对齐GRPO 联合优化三个维度语义准确性 + 声学质量 + 音色相似度
语义蒸馏w2v-BERT 2.0 激活回归确保第一个码本捕获语言信息
富转录 ASRQwen3-Omni-30B-A3B 微调说话人轮换 + 语音事件标注
流式架构因果卷积 + 滑动窗口 Transformer21 Hz 帧率,实时流式传输

八、实验结果

客观评估

Seed-TTS-Eval(WER %):

模型test-zhtest-enzh-hard
Fish Audio S20.540.995.99
Fish Audio S10.541.0717.00
CosyVoice 3-1.5B1.122.215.83
Qwen3-TTS0.771.24-
Seed-TTS1.122.257.59
MiniMax Speech-020.991.90-

关键发现: Fish Audio S2 在中文和英文 WER 上均达到最优,中文硬案例 WER 从 S1 的 17.00% 大幅降低至 5.99%。

多语言评估(Minimax Testset - WER %)

语言MiniMaxElevenLabsFish Audio S2Fish Audio S1
中文2.25216.0260.7300.980
英文2.1642.3391.6202.370
日语3.51910.6462.7603.450
韩语1.7471.8651.1801.990
德语1.9060.5720.5500.650
法语4.0995.2163.0505.700
西班牙语1.0291.0840.9101.780

关键发现: Fish Audio S2 在 7 种语言中的 6 种上超越所有基线,仅德语略逊于 ElevenLabs。

长音频基准

模型英文 WER英文 SIM-Mean英文 SIM-Std中文 CER中文 SIM-Mean中文 SIM-Std
Fish Audio S24.380.5230.07615.950.5570.0923
Fish Audio S16.260.4360.1086.440.5050.108
Qwen3-TTS7.690.3900.07378.090.5740.0614

关键发现: Fish Audio S2 在长音频合成中显著优于 S1 和 Qwen3-TTS,WER 降低 30%+,说话人相似度提升 20%+。

LLM-as-a-Judge 评估

Audio Turing Test(后验均值):

模型均值 (标准差)95% HDI
Fish Audio S2 (w/ instruction)0.515 (0.061)[0.510, 0.521]
Fish Audio S20.483 (0.068)[0.477, 0.489]
Fish Audio S10.479 (0.087)[0.471, 0.486]
Seed-TTS0.417 (0.011)[0.398, 0.438]
MiniMax-Speech0.387 (0.011)[0.368, 0.407]
GPT-4o0.138 (0.011)[0.118, 0.158]

关键发现: Fish Audio S2 带指令版本得分 0.515,超过人类基准(0.5),表明生成的语音几乎无法与真人区分。

Emergent TTS Eval(胜率 %):

模型WER胜率
Fish Audio S2 (强提示)8.1581.88%
Gemini-2.5-Flash-Preview-TTS6.3579.10%
gpt-4o-audio-preview7.7577.36%
Fish Audio S17.6036.88%

指令跟随基准

数据集指标Fish Audio S2Fish Audio S1
中文TAR0.9840.942
中文自然度4.404.15
中文表现力4.944.65
英文TAR0.8810.626
英文自然度4.213.71
英文表现力4.503.93

关键发现: Fish Audio S2 在指令跟随准确率上大幅提升,英文 TAR 从 0.626 提升至 0.881(+40%)。

九、与现有方法对比

系统架构RL 对齐多说话人指令控制开源
Fish Audio S2Dual-AR (Qwen3-4B)GRPO 多维度原生支持自然语言完全开源
Fish Audio S1Dual-AR无有限有限开源
CosyVoice 3Flow Matching无支持有限部分开源
Qwen3-TTSTransformer无支持有限部分开源
Seed-TTSTransformerDPO支持有限不开源
MiniMax Speech-02未知未知支持支持不开源
GPT-4o TTS未知未知支持支持不开源

十、总结

核心贡献

  1. Dual-AR 架构: 解耦时间语义建模和深度声学建模,Slow AR (Qwen3-4B) 处理语义,Fast AR (4层Transformer) 处理声学细节
  2. 多用途数据管道: 语音质量模型和富转录 ASR 模型同时用于预训练过滤和 RL 奖励信号,消除分布偏移
  3. 多维度 RL 对齐: 基于 GRPO 联合优化语义准确性、声学质量和说话人相似度
  4. 生产级推理引擎: 基于 SGLang,RTF 0.195,TTFA <100ms,3000+ tokens/秒
  5. 完全开源: 模型权重、微调代码、推理引擎全部开源

技术影响

  • TTS 领域: 首个在 Audio Turing Test 中超过人类基准的开源系统
  • RL 对齐: 将 LLM 领域的 GRPO 成功应用于 TTS,为语音合成的 RL 对齐开辟新方向
  • 数据工程: 多用途数据管道设计范式,消除预训练和 RL 阶段的分布偏移
  • 开源生态: 为社区提供完整的 TTS 训练和推理基础设施

局限性

  • 仅提供技术报告,缺少详细的消融实验
  • RL 训练细节(如奖励权重、采样策略)未充分公开
  • 长音频合成的稳定性仍需进一步验证
  • 多说话人对话的自然度在复杂场景下可能下降

适用场景

  • 有声书朗读和视频配音
  • 个性化聊天机器人语音
  • 多语言语音合成
  • 实时流式语音生成
  • 细粒度语音风格控制

十一、参考资源