
VoxCPM2 是 OpenBMB 开源的多语种 TTS 模型,README 里的定位是 Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning。它不走离散 token 化路线,而是通过端到端 diffusion autoregressive 架构直接生成连续语音表示。
这一版是 2B 参数模型,训练数据超过 200 万小时,支持 30 种语言,以及四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话等中文方言。输出方面支持 48kHz studio-quality audio。
它的几个亮点很适合语音产品:Voice Design 可以只用自然语言描述创造新声音,不需要参考音频;Controllable Voice Cloning 可以用短参考音频克隆音色,同时用控制指令调整情绪、语速和表达;Ultimate Cloning 则通过参考音频和转写文本尽量复现音色、节奏、情绪和风格。
项目提供 Python API、CLI、Web Demo,也支持 Nano-vLLM 和 vLLM-Omni 的生产部署路径。代码和权重采用 Apache-2.0 许可,可商用,对想做多语种配音、语音克隆、AI 旁白和语音助手的人很值得关注。
传送门
https://github.com/OpenBMB/VoxCPM
原创文章,如若转载,请注明出处:https://wefound.cc/p/2173.html