VoxCPM(语音合成)

VoxCPM(语音合成)

音频与语音
OpenBMB(清华大学)
开源免费

关于

OpenBMB 的免 Tokenizer TTS 系统:直接生成连续语音表征,2B 参数、30 种语言、语音设计、可控语音克隆、48kHz 录音室级音频输出。

分享此工具

编辑评价

值得尝试

OpenBMB 的免 Tokenizer TTS 突破——30 语言、语音设计、48kHz 输出,但需要较强 GPU。

VoxCPM2 代表了开源 TTS 的重大进步:其免 Tokenizer 扩散自回归架构比离散 token 方案产生更自然的语音,单一模型覆盖 30 种语言且自动检测令人印象深刻。语音设计功能(从文本描述创建声音)和终极克隆(从参考音频+文本复制每一个细节)是真正有用的能力。\n\n注意事项:实时推理需要 RTX 4090 级别 GPU,文档分散,101 个未关闭 issue 表明仍在持续开发中。对需要高质量多语言 TTS 且带语音设计能力的研究人员、内容创作者和开发者来说,VoxCPM2 是一个引人注目的开源选择。

最适合

  • 需要高质量多语言 TTS 且带语音设计与克隆能力、且有较强 GPU(RTX 4090 或以上)的研究人员、内容创作者与开发者。

以下情况建议考虑替代方案

  • 如果没有较强 GPU,考虑云端 TTS API(ElevenLabs、OpenAI TTS)或在 CPU 上运行的轻量开源模型。

平台支持

网页版WindowsmacOSLinuxAPI

可用平台包括网页版、Windows、macOS、Linux和API。

核心功能

免 Tokenizer 架构:通过扩散自回归模型直接生成连续语音表征
20 亿参数模型(VoxCPM2),基于 200 万+ 小时多语言语音数据训练
支持 30 种语言——无需语言标签,自动从输入文本识别
语音设计:仅凭自然语言描述(性别、年龄、语气、情感、语速)创建全新声音
可控语音克隆:从短参考片段克隆任意声音,支持风格引导
终极克隆:从参考音频+文本复制每一个声音细节
48kHz 录音室级音频输出,AudioVAE V2 内置超分辨率
实时流式输出:RTX 4090 上 RTF 低至 ~0.3,Nano-vLLM 加速 ~0.13
上下文感知合成:自动从文本内容推断合适的韵律与表现力
基于 OpenBMB MiniCPM-4 骨干网络

定价方案

free
免费开源(Apache 2.0)。模型权重在 Hugging Face 和 ModelScope 上可用。

使用场景

多语言语音合成用于内容创作、配音与无障碍
虚拟助手、游戏角色和品牌声音的语音设计
高保真语音克隆用于个性化语音应用

优点

免 Tokenizer 架构比离散 token TTS 产生更自然、更具表现力的语音
单一模型支持 30 种语言,自动语言检测
自然语言描述即可设计语音——无需参考音频
48kHz 录音室级输出,内置超分辨率
Apache 2.0 协议,来自声誉良好的 OpenBMB 团队(清华大学)

缺点

需要较强 GPU 资源(推荐 RTX 4090)才能实时推理
核验时 101 个未关闭 issue
文档分散在 GitHub、ReadTheDocs 和 Hugging Face 多个平台
上次推送 35 天前——活跃度中等

最新动态

2026年7月:VoxCPM2 发布,2B 参数、30 语言、语音设计、可控克隆、48kHz 输出与实时流式。

订阅 AI 资讯

获取最新 AI 工具推荐、行业动态和深度分析,每周精选直达邮箱。

我们尊重你的隐私,随时可以取消订阅。