TTS 语音模型盘点:25MB 的本地小模型,和「像本人」的复刻天花板

别急着续配音会员:25MB 的 KittenTTS 塞进笔记本就能开口;盲测里,Chatterbox Turbo 对 ElevenLabs 同代款的胜率是 65.3%;Fish S2 Pro 的中英念错率(WER)0.54%/0.99% 压过一批闭源付费系统——而这一整套,月费 0。

TL;DR

效果先行:先看「两端」的数字

极小端 复刻端
代表体积 25MB(KittenTTS nano,15M 参数) 500M(Chatterbox V3)到 4B(Fish S2 Pro)
硬件 普通 CPU,无需显卡 中端以上 GPU;VoxCPM2 在苹果芯片走 MPS 也能跑
语言 英文(Kitten);中英等 20 语(MOSS) 23 到 80+ 语言,含中文方言
克隆 MOSS-Nano 支持(长文自动分块) 这就是它们的看家本领
花钱 0 0(用自己机器)

一句话版:小模型解决「有没有」,大模型解决「像不像」。

从 25MB 到 4B:两端都有免费能打的
从 25MB 到 4B:两端都有免费能打的

效果对标:离「官方顶配」多近?

直接盲测,开源款已经赢过 ElevenLabs 一局。 Resemble 官方做了一组盲测(Podonos 平台:5 到 10 秒参考音、同一段文本、零样本):Chatterbox Turbo 对阵 ElevenLabs Turbo v2.5,65.3% 的听众选 Chatterbox,24.5% 选 ElevenLabs(其余平票);对阵 Cartesia Sonic 3 是 49.8%,对阵 VibeVoice 7B 是 59.1%。

念错率(WER,越低越好):Fish S2 Pro 中文 0.54%、英文 0.99%,在其官方评测里好于 Qwen3-TTS(0.77 / 1.24)、MiniMax Speech-02(0.99 / 1.90)、Seed-TTS(1.12 / 2.25)——全是闭源或云端系统。

克隆「像不像」(SS 相似度,越高越好):同一张评测表(CV3-Eval)里,0.8B 的 IndexTTS2.5-RL 平均 73.6、2B 的 VoxCPM2 72.0、CosyVoice3 中文单科 80.0——彼此只差几分,到了人耳要盲测才分得出的区间。

行业背景补一句:独立盲测榜 Speech Arena 的榜首两个月换过两次(Inworld 顶掉 ElevenLabs,随后阿里的 Qwen-Audio 登顶),前几名彼此只差几十 Elo。「最好听」不再由付费巨头垄断,比的就是谁更合适你的场景。

人话版:日常口播、配音、有声书,本地这几款跟订阅制产品的听感在同一档;极端情绪、超长文本的稳定性各家有强弱,最稳的办法是拿你自己的稿子去在线 Demo 试听一遍——耳朵说了算。

成本:一年能省多少钱

ElevenLabs 官方口径:1,000 字符约等于 1 分钟音频,免费档每月只送 10,000 credits(约 10 分钟),多一点就要按月付费:

你的用量 云端(ElevenLabs 官方价格) 本地版
每月 10 分钟 免费档,刚好用完 不限量
每月 1 小时(周更 3 条 5 分钟配音) Creator 档 22 美元/月(约 160 块)→ 一年约 1,900 块 0 元
每月 10 小时(有声书量级) Pro 档 99 美元/月(约 700 块)→ 一年约 8,400 块 0 元
要「像本人」的克隆 Creator 档起才给专业克隆(22 美元/月起) Apache/MIT 模型免费、不限次
同样的量:云端一年 1,900–8,400 块,本地 0 元
同样的量:云端一年 1,900–8,400 块,本地 0 元

国内对标:魔音工坊会员 48 元/月起,「一句话克隆」加不限下载的全场声音会员 199 元/月起(第三方攻略页整理,以官网为准)。

一句话总结:订阅费的本质是「额度费」。本地版把额度这个概念删掉了——跑一小时语音,电费按毛算。

诚实提示:想跑到「榜霸」那档(Fish)需要一块大显存显卡;装环境要花一杯咖啡的工夫。省的是长期的钱和额度,花的是首次折腾的时间。

运行环境:哪台设备能跑

你的设备 能跑什么 实感
任何一台电脑(纯 CPU) KittenTTS、MOSS-TTS-Nano 小模型即装即用;MOSS 单核都能出声
安卓手机 / 浏览器 MOSS-TTS-Nano 官方有安卓 ONNX 示例、浏览器朗读插件
Mac(M 系芯片) VoxCPM2(自动 MPS)、MOSS(mlx) VoxCPM2 还有 GGUF 版走 Metal,速度比实时略慢
8GB 显存独显 VoxCPM2(约占 8GB)、Chatterbox 全系、IndexTTS / CosyVoice 4090 上约 3 秒出 10 秒语音(RTF 0.3)
24GB 级大卡 Fish S2 Pro 4B 官方流式演示用单张 H200——天花板住在这儿

口径来自各家官方 README 与文档:Windows / macOS / Linux 全支持,Python 3.8 起步(Chatterbox 要求 3.11)。

核心优势:凭什么选它

极小端:装进兜里的三个

1. KittenTTS——25MB,小到离谱

pip install https://github.com/KittenML/KittenTTS/releases/download/0.8.1/kittentts-0.8.1-py3-none-any.whl

2. MOSS-TTS-Nano——0.1B,中文和克隆都能打

3. Chatterbox-Nano——110M,英文实时款

补充一个:Supertonic(99M、31 语、速度极快)曾是这个赛道的明星,但仓库已归档停更、且不支持中文——新项目别拿它当主力。

复刻端:三款「像本人」的

1. Fish Audio S2 Pro——数据最猛,许可最严

2. VoxCPM2——商用最放心,还能「画」新声音

3. Chatterbox Multilingual V3——许可最宽松的全能选手

再加两个国产选项:CosyVoice 3(阿里系,Apache-2.0,2.4 万星)和 IndexTTS(B 站系,中文情绪控制很强,最新已到 2.5,商用需联系官方)——选择困难时,先拿在线 Demo 听一耳朵最实在。

三步上手

  1. 先试听:上表几家都有在线 Demo,打开就能听,不用装任何东西。
  2. 装最小的:KittenTTS 一条 pip(见上文);中文换 MOSS-TTS-Nano,git clone 后 python infer.py,参考音频 10 秒即克隆。
  3. 上强度:pip install voxcpm(苹果芯片自动 MPS)或 pip install chatterbox-tts;还嫌不够像,再考虑 4B 的 Fish。

选型速查表

模型 体积/参数 语言 克隆 许可 适合谁
KittenTTS 25 到 80MB 英文 无 Apache-2.0 桌面小工具、英文朗读
MOSS-TTS-Nano 0.1B 中英等 20 语 支持 Apache-2.0 中文入门、轻量克隆
Chatterbox-Nano 110M 英文 支持 MIT 英文实时、端侧
Fish S2 Pro 4B 80+ 支持(强) 研究许可(严) 效果优先、非商用
VoxCPM2 2B 30 语+8 方言 支持(强) Apache-2.0 中文商用、苹果芯片
Chatterbox V3 500M 23+ 支持 MIT 跨语言、怕许可坑
CosyVoice 3 0.5B 中英日韩等 支持 Apache-2.0 国产备选

三个坑(都有人栽过)

  1. 许可分三级:MIT/Apache(放心商用)→ 研究许可(Fish 这类,条款写明商用追责)→ 非商用。做产品前先翻 LICENSE 的商用条款,别等收律师函。
  2. 语言别默认:KittenTTS 只英文、Supertonic 31 语偏偏没中文——下载前翻到「Supported Languages」再动手,省得白下几个 G。
  3. 克隆有红线:微软 VibeVoice 在 2025 年 9 月因滥用案例把 TTS 代码整段下架(README 至今挂着这则说明)——未经授权克隆真人声音、做假语音,会被平台级反制;发布 AI 生成语音记得按规定标注。

链接与下载渠道

下载提速先说:HuggingFace 下载慢,先在终端加一行 export HF_ENDPOINT=https://hf-mirror.com 走公开镜像;有 ModelScope(魔搭)版的优先用国内源。

逐款直达:仓库 → 模型下载 → 试听

技能包(给你的 AI 助手一行装)

AI 配置提示词(复制即用)

帮我在这台电脑上搭一套本地 TTS(HuggingFace 下载慢就设 HF_ENDPOINT=https://hf-mirror.com,有 ModelScope 版的优先用魔搭源),按顺序来:
1. 先装最小的 KittenTTS(按官方 README 的 pip 命令),跑一版英文样例;
2. 再装 MOSS-TTS-Nano(中文+克隆),用我给的 10 秒参考音频克隆,生成一段中文;
3. 对比两者的音质、生成速度、内存占用,做成一张表给我;
4. 我的机器配置是:____;如果够装 VoxCPM2(终极克隆),先估算资源占用再问我要不要装;
5. 每一步都帮我核对许可条款,标出「能不能商用」。

用法样例(对模型提要求时这么写)

来源与时效

← 回到首页邮件订阅 →更新于 2026-09-21