AI 音频

Chatterbox

MIT 开源 TTS SoTA · 5 秒零样本克隆 · 情绪强度可控 · Turbo 350M 消费卡可跑

免费开源支持中文

Chatterbox 是 Resemble AI 开源的文本转语音(TTS)模型,MIT 协议,GitHub 26.6k star,号称开源 TTS 的 SOTA。基于 0.5B 规模的 LLaMA 架构,用超过 50 万小时精选音频训练,核心卖点:零样本语音克隆——给 5 秒参考音频即可克隆出该人声;情绪强度可控——不只读出来,还能调情绪与强烈程度,从平淡陈述到激昂喊话;MIT 免费,个人和商业都能用,代码与权重全公开。Turbo 版精简到 350M 参数,把语音令牌到梅尔频谱的解码从 10 步压到 1 步,推理延迟大幅下降、显存占用大幅降低,消费级显卡甚至 CPU/MPS 都能跑,AMD 走 PyTorch 后端 ROCm 可运行。Resemble 在 Podonos 平台做可复现盲测,对线 ElevenLabs Turbo v2.5、Cartesia Sonic 3、VibeVoice 7B,社区盲测普遍认为其自然度追平甚至超越 ElevenLabs 部分版本。适合不想按字付费、要做有声书配音短视频旁白、要克隆个性化声音、AMD 用户本地跑 TTS 的场景。