Voicebox

Voicebox

音频与语音
jamiepine
免费开源API

关于

开源 AI 语音工作室,本地运行的声音克隆/语音合成/听写/智能体语音一体化工具,免费替代 ElevenLabs + WisprFlow,支持 7 种 TTS 引擎和 23 种语言

分享此工具

编辑评价

强烈推荐

开源语音 AI 的新标杆

Voicebox 在短短 6 个月内获得 48k+ GitHub 星标,迅速成为 2026 年最令人印象深刻的开源 AI 项目之一。其声音克隆、7 种 TTS 引擎、MCP 智能体集成和本地优先架构的组合确实独一无二——没有其他开源项目提供同样的广度。单一维护者风险和部分 Windows GPU 问题是真实存在的顾虑,但开发速度和社区响应都非常出色。对于任何想要掌控自己语音 AI 栈的人来说,Voicebox 是明确的选择。

最适合

  • 需要免费本地声音克隆的内容创作者
  • 将语音集成到 AI 智能体工作流的开发者
  • 注重隐私、避免云端 TTS 服务的用户

以下情况建议考虑替代方案

  • 你需要零设置的云端 TTS(ElevenLabs)
  • 你只需要语音输入而不需要输出(WisprFlow)

平台支持

WindowsmacOSLinuxAPI

可用平台包括Windows、macOS、Linux和API。

核心功能

从 3 秒音频即可克隆声音
7 种 TTS 引擎:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox、TADA、Kokoro
全局热键听写,基于 Whisper STT(5 种模型大小)
AI 智能体 MCP 集成(Claude Code、Cursor、Cline)
REST API 完整程序化控制
故事编辑器:多角色叙事
音频效果管线:音高、混响、延迟、合唱、压缩
角色系统:用角色风格改写和创作
支持 23 种语言
无限生成长度,自动分块和交叉淡入淡出
本地或远程 GPU 推理(Metal、CUDA、ROCm、Intel Arc、DirectML)
端到端加密云备份(可选,即将推出 $12/年)

定价方案

free
免费(本地应用,开源,永久免费)
paid
云备份 $12/年(端到端加密备份与同步,即将推出)

使用场景

需要配音和旁白的内容创作者
AI 智能体语音输出用于开发工作流
多角色播客和有声书制作
游戏 NPC 对话生成和本地化

优点

完全免费开源(MIT 许可证)
真正的本地优先——一切在本地运行,无需云端依赖
声音克隆、语音合成、听写、智能体语音四合一
活跃开发,48k+ GitHub 星标,维护者响应迅速
MCP 集成使其天然适合 AI 智能体工作流
7 种 TTS 引擎 + 23 种语言,灵活度极高

缺点

没有预编译 Linux 二进制文件(需从源码构建)
Windows GPU 支持在预编译版本中存在问题
GitHub 上 572 个开放 Issue——多为功能请求但有部分 Bug
云备份和同步功能尚未可用(即将推出)
单一维护者驱动——存在 bus factor 风险
需要 GPU 才能获得最佳性能(CPU 可用但较慢)

最新动态

2026年8月:v0.5.0 发布,48k+ GitHub 星标,150 万+ 下载

4 步快速上手

5 步完成配置,开始使用

1

下载 Voicebox

从 GitHub 下载最新版本(macOS、Windows、Linux)。

下载
https://github.com/jamiepine/voicebox/releases
2

克隆或选择声音

导入音频文件、从麦克风录制或捕获系统音频。Voicebox 只需 3 秒即可克隆声音。

3

生成语音

输入文本并选择 TTS 引擎。Voicebox 支持 7 种引擎。

API
curl -X POST http://127.0.0.1:17493/generate -H "Content-Type: application/json" -d '{"text":"你好","profile_id":"YOUR_PROFILE_ID","engine":"qwen_custom_voice"}' --output hello.wav
4

通过 MCP 连接 AI 智能体

将 Voicebox 添加到 MCP 配置,让 AI 智能体用克隆的声音说话。

MCP 配置
{ "mcpServers": { "voicebox": { "url": "http://127.0.0.1:17493/mcp" } } }

订阅 AI 资讯

获取最新 AI 工具推荐、行业动态和深度分析,每周精选直达邮箱。

我们尊重你的隐私,随时可以取消订阅。