
Voicebox
音频与语音
jamiepine
免费开源API
关于
开源 AI 语音工作室,本地运行的声音克隆/语音合成/听写/智能体语音一体化工具,免费替代 ElevenLabs + WisprFlow,支持 7 种 TTS 引擎和 23 种语言
编辑评价
强烈推荐开源语音 AI 的新标杆
Voicebox 在短短 6 个月内获得 48k+ GitHub 星标,迅速成为 2026 年最令人印象深刻的开源 AI 项目之一。其声音克隆、7 种 TTS 引擎、MCP 智能体集成和本地优先架构的组合确实独一无二——没有其他开源项目提供同样的广度。单一维护者风险和部分 Windows GPU 问题是真实存在的顾虑,但开发速度和社区响应都非常出色。对于任何想要掌控自己语音 AI 栈的人来说,Voicebox 是明确的选择。
最适合
- •需要免费本地声音克隆的内容创作者
- •将语音集成到 AI 智能体工作流的开发者
- •注重隐私、避免云端 TTS 服务的用户
以下情况建议考虑替代方案
- •你需要零设置的云端 TTS(ElevenLabs)
- •你只需要语音输入而不需要输出(WisprFlow)
平台支持
WindowsmacOSLinuxAPI
可用平台包括Windows、macOS、Linux和API。
核心功能
从 3 秒音频即可克隆声音
7 种 TTS 引擎:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox、TADA、Kokoro
全局热键听写,基于 Whisper STT(5 种模型大小)
AI 智能体 MCP 集成(Claude Code、Cursor、Cline)
REST API 完整程序化控制
故事编辑器:多角色叙事
音频效果管线:音高、混响、延迟、合唱、压缩
角色系统:用角色风格改写和创作
支持 23 种语言
无限生成长度,自动分块和交叉淡入淡出
本地或远程 GPU 推理(Metal、CUDA、ROCm、Intel Arc、DirectML)
端到端加密云备份(可选,即将推出 $12/年)
定价方案
free
免费(本地应用,开源,永久免费)
paid
云备份 $12/年(端到端加密备份与同步,即将推出)
使用场景
需要配音和旁白的内容创作者
AI 智能体语音输出用于开发工作流
多角色播客和有声书制作
游戏 NPC 对话生成和本地化
优点
完全免费开源(MIT 许可证)
真正的本地优先——一切在本地运行,无需云端依赖
声音克隆、语音合成、听写、智能体语音四合一
活跃开发,48k+ GitHub 星标,维护者响应迅速
MCP 集成使其天然适合 AI 智能体工作流
7 种 TTS 引擎 + 23 种语言,灵活度极高
缺点
没有预编译 Linux 二进制文件(需从源码构建)
Windows GPU 支持在预编译版本中存在问题
GitHub 上 572 个开放 Issue——多为功能请求但有部分 Bug
云备份和同步功能尚未可用(即将推出)
单一维护者驱动——存在 bus factor 风险
需要 GPU 才能获得最佳性能(CPU 可用但较慢)
最新动态
2026年8月:v0.5.0 发布,48k+ GitHub 星标,150 万+ 下载
4 步快速上手
5 步完成配置,开始使用
4 步快速上手
5 步完成配置,开始使用
1
下载 Voicebox
从 GitHub 下载最新版本(macOS、Windows、Linux)。
下载
https://github.com/jamiepine/voicebox/releases2
克隆或选择声音
导入音频文件、从麦克风录制或捕获系统音频。Voicebox 只需 3 秒即可克隆声音。
3
生成语音
输入文本并选择 TTS 引擎。Voicebox 支持 7 种引擎。
API
curl -X POST http://127.0.0.1:17493/generate -H "Content-Type: application/json" -d '{"text":"你好","profile_id":"YOUR_PROFILE_ID","engine":"qwen_custom_voice"}' --output hello.wav4
通过 MCP 连接 AI 智能体
将 Voicebox 添加到 MCP 配置,让 AI 智能体用克隆的声音说话。
MCP 配置
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp"
}
}
}