
Voicebox
Acerca de
Estudio de voz AI de código abierto que se ejecuta localmente — clonación de voz, TTS en 7 motores, dictado y voz de agente en una sola app. Una alternativa gratuita a ElevenLabs y WisprFlow, compatible con 23 idiomas.
Nuestro Veredicto
Altamente RecomendadoUn nuevo estándar para la voz AI de código abierto
Voicebox se ha convertido rápidamente en uno de los proyectos de IA de código abierto más impresionantes de 2026, obteniendo 48k+ estrellas en GitHub en solo 6 meses. Su combinación de clonación de voz, 7 motores TTS, integración de agentes MCP y arquitectura local-first es genuinamente única. El riesgo de un solo mantenedor y algunos problemas de GPU en Windows son preocupaciones reales, pero el ritmo de desarrollo y la respuesta de la comunidad son excepcionales.
Ideal para
- •Creadores de contenido que buscan clonación de voz local gratuita
- •Desarrolladores que integran voz en flujos de trabajo de agentes de IA
- •Usuarios preocupados por la privacidad que evitan servicios TTS en la nube
Considera alternativas si
- •Necesitas TTS en la nube sin configuración (ElevenLabs)
- •Solo necesitas entrada de voz, no salida (WisprFlow)
Plataformas compatibles
Las plataformas disponibles incluyen Windows, macOS, Linux y API.
Características Principales
Precios
Casos de Uso
Ventajas
Desventajas
Última Actualización
Agosto 2026: lanzamiento v0.5.0, 48k+ estrellas GitHub, 1.5M+ descargas
Comienza en 4 Pasos
Empieza en 5 pasos
Comienza en 4 Pasos
Empieza en 5 pasos
Descargar Voicebox
Descarga la última versión desde GitHub (macOS, Windows, Linux).
https://github.com/jamiepine/voicebox/releasesClonar o seleccionar una voz
Importa un archivo de audio, graba desde el micrófono o captura audio del sistema.
Generar voz
Escribe texto y elige un motor TTS. Voicebox soporta 7 motores.
curl -X POST http://127.0.0.1:17493/generate ...Conectar a agentes de IA vía MCP
Añade Voicebox a tu configuración MCP para que los agentes AI hablen con tus voces clonadas.
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp"
}
}
}Herramientas de Audio y Voz relacionadas
Plataforma líder de síntesis y clonación de voz IA con soporte multilingüe
Modelo de reconocimiento de voz de código abierto de OpenAI para conversión de voz a texto multilingüe
Plataforma de generación de voz del equipo tras el TTS de código abierto Fish Speech. Clona una voz con solo 10-30 segundos de audio; los modelos S1/S2 ofrecen habla natural y expresiva, con uso comercial y API de pago por uso
Plataforma de generación de voz de MiniMax. La familia de modelos Speech ofrece TTS hiperrealista en más de 40 idiomas con clonación de voz de 10 segundos, etiquetas controlables de emoción y efectos, y prueba web gratuita