
VoxCPM
Acerca de
Sistema TTS sin tokenizador de OpenBMB: genera directamente representaciones continuas de voz mediante arquitectura autoregresiva de difusión. Modelo de 2B parámetros, 30 idiomas, Diseño de Voz, clonación de voz controlable, audio 48kHz de calidad de estudio.
Nuestro Veredicto
Vale la Pena ProbarUn avance TTS sin tokenizador de OpenBMB — 30 idiomas, diseño de voz y salida 48kHz, pero requiere GPU potente.
VoxCPM2 representa un avance significativo en TTS de código abierto: su arquitectura autorregresiva de difusión sin tokenizador produce voz más natural que las alternativas de tokens discretos, y el modelo único que cubre 30 idiomas con detección automática es impresionante. La función de Diseño de Voz (crear una voz desde una descripción de texto) y la Clonación Definitiva (reproducir cada matiz del audio de referencia + transcripción) son capacidades genuinamente útiles.\n\nAdvertencias: la inferencia en tiempo real necesita una GPU clase RTX 4090, la documentación está dispersa y los 101 issues abiertos sugieren desarrollo continuo. Para investigadores, creadores de contenido y desarrolladores que necesitan TTS multilingüe de alta calidad con capacidades de diseño de voz, VoxCPM2 es una opción convincente de código abierto.
Ideal para
- •Investigadores, creadores de contenido y desarrolladores que necesiten TTS multilingüe de alta calidad con diseño y clonación de voz, y tengan acceso a una GPU potente (RTX 4090 o superior).
Considera alternativas si
- •Si no tienes una GPU potente, considera APIs TTS en la nube (ElevenLabs, OpenAI TTS) o modelos open source ligeros que funcionen en CPU.
Plataformas compatibles
Las plataformas disponibles incluyen Aplicación web, Windows, macOS, Linux y API.
Características Principales
Precios
Casos de Uso
Ventajas
Desventajas
Última Actualización
Julio 2026: VoxCPM2 lanzado con 2B parámetros, 30 idiomas, Diseño de Voz, clonación controlable, salida 48kHz y streaming en tiempo real.
Herramientas de Audio y Voz relacionadas
Plataforma líder de síntesis y clonación de voz IA con soporte multilingüe
Modelo de reconocimiento de voz de código abierto de OpenAI para conversión de voz a texto multilingüe
Plataforma de generación de voz del equipo tras el TTS de código abierto Fish Speech. Clona una voz con solo 10-30 segundos de audio; los modelos S1/S2 ofrecen habla natural y expresiva, con uso comercial y API de pago por uso
Plataforma de generación de voz de MiniMax. La familia de modelos Speech ofrece TTS hiperrealista en más de 40 idiomas con clonación de voz de 10 segundos, etiquetas controlables de emoción y efectos, y prueba web gratuita