chatterbox/hero.jpg" alt="Chatterbox 开源 TTS 与情绪控制示意">

订阅了 ElevenLabs 想省钱的先停一下:网上刷屏的"ElevenLabs 开源平替"不是 ElevenLabs 自己,而是 Resemble AI 放出来的 Chatterbox——MIT 协议、26.6k star、号称开源 TTS 的 SOTA。先说清楚一件事:ElevenLabs 是闭源商业公司,它自己没有开源;Chatterbox 是第三方做的本地平替,跑在你自己显卡上。

它是什么

Chatterbox 是 Resemble AI 开源的文本转语音(TTS)模型,基于 0.5B 规模的 LLaMA 架构,用超过 50 万小时精选音频训练。核心卖点三件事:

GitHub:github.com/resemble-ai/chatterbox(26.6k star / 3.6k fork,2026-07 还在更新)

Turbo 版:为什么它跑得动

真正的惊喜是 Chatterbox Turbo——把原版 0.5B 精简到 350M 参数,关键改动是把"语音令牌 → 梅尔频谱"的解码从 10 步压到 1 步。

这个改动意味着什么:

换句话说,它把一个"要 A100 才爽"的模型,压成了"你那张 R9700/7900XTX 就能跑"的模型。

和 ElevenLabs 对比

Resemble 用 Podonos 平台做了可复现的盲测,直接拿 Chatterbox Turbo 对线:

评测维度是整体偏好、自然度、表现力。社区盲测的普遍结论是 Chatterbox 在自然度上追平甚至超过 ElevenLabs 的部分版本——具体听感因人而异,但"本地能跑出这个水平"这件事本身是实锤。

本地跑起来

git clone https://github.com/resemble-ai/chatterbox
cd chatterbox
pip install -e .

官方给了 example_tts.py(标准版)、example_tts_turbo.py(Turbo)、example_tts_nano.py(Nano 轻量版)三个入口,macOS 还有专门的 example_for_mac.py(MPS 支持)。多语言版本需要 opt-in 指定 checkpoint。

一个细节:水印

Chatterbox 生成音频默认带 Perth 隐形水印,可以用 perth + librosa 检测(输出 0.0 无水印 / 1.0 有水印)。做内容分发时留意这条,避免"是不是用 AI 生成的"这个争议。

适合谁

一句话结论

Chatterbox 是当下最接近"ElevenLabs 体验"的开源本地 TTS——MIT 免费、情绪可控、Turbo 版消费级显卡能跑。ElevenLabs 本身没开源,想要本地化的,用它。

参考:GitHub resemble-ai/chatterbox、Podonos 对比评测页、官方 demopage。