
VoxCPM(语音合成)
音频与语音
OpenBMB(清华大学)
开源免费
关于
OpenBMB 的免 Tokenizer TTS 系统:直接生成连续语音表征,2B 参数、30 种语言、语音设计、可控语音克隆、48kHz 录音室级音频输出。
编辑评价
值得尝试OpenBMB 的免 Tokenizer TTS 突破——30 语言、语音设计、48kHz 输出,但需要较强 GPU。
VoxCPM2 代表了开源 TTS 的重大进步:其免 Tokenizer 扩散自回归架构比离散 token 方案产生更自然的语音,单一模型覆盖 30 种语言且自动检测令人印象深刻。语音设计功能(从文本描述创建声音)和终极克隆(从参考音频+文本复制每一个细节)是真正有用的能力。\n\n注意事项:实时推理需要 RTX 4090 级别 GPU,文档分散,101 个未关闭 issue 表明仍在持续开发中。对需要高质量多语言 TTS 且带语音设计能力的研究人员、内容创作者和开发者来说,VoxCPM2 是一个引人注目的开源选择。
最适合
- •需要高质量多语言 TTS 且带语音设计与克隆能力、且有较强 GPU(RTX 4090 或以上)的研究人员、内容创作者与开发者。
以下情况建议考虑替代方案
- •如果没有较强 GPU,考虑云端 TTS API(ElevenLabs、OpenAI TTS)或在 CPU 上运行的轻量开源模型。
平台支持
网页版WindowsmacOSLinuxAPI
可用平台包括网页版、Windows、macOS、Linux和API。
核心功能
免 Tokenizer 架构:通过扩散自回归模型直接生成连续语音表征
20 亿参数模型(VoxCPM2),基于 200 万+ 小时多语言语音数据训练
支持 30 种语言——无需语言标签,自动从输入文本识别
语音设计:仅凭自然语言描述(性别、年龄、语气、情感、语速)创建全新声音
可控语音克隆:从短参考片段克隆任意声音,支持风格引导
终极克隆:从参考音频+文本复制每一个声音细节
48kHz 录音室级音频输出,AudioVAE V2 内置超分辨率
实时流式输出:RTX 4090 上 RTF 低至 ~0.3,Nano-vLLM 加速 ~0.13
上下文感知合成:自动从文本内容推断合适的韵律与表现力
基于 OpenBMB MiniCPM-4 骨干网络
定价方案
free
免费开源(Apache 2.0)。模型权重在 Hugging Face 和 ModelScope 上可用。
使用场景
多语言语音合成用于内容创作、配音与无障碍
虚拟助手、游戏角色和品牌声音的语音设计
高保真语音克隆用于个性化语音应用
优点
免 Tokenizer 架构比离散 token TTS 产生更自然、更具表现力的语音
单一模型支持 30 种语言,自动语言检测
自然语言描述即可设计语音——无需参考音频
48kHz 录音室级输出,内置超分辨率
Apache 2.0 协议,来自声誉良好的 OpenBMB 团队(清华大学)
缺点
需要较强 GPU 资源(推荐 RTX 4090)才能实时推理
核验时 101 个未关闭 issue
文档分散在 GitHub、ReadTheDocs 和 Hugging Face 多个平台
上次推送 35 天前——活跃度中等
最新动态
2026年7月:VoxCPM2 发布,2B 参数、30 语言、语音设计、可控克隆、48kHz 输出与实时流式。