VoxCPM

VoxCPM

Audio y Voz
OpenBMB (Tsinghua University)
Código AbiertoGratis

Acerca de

Sistema TTS sin tokenizador de OpenBMB: genera directamente representaciones continuas de voz mediante arquitectura autoregresiva de difusión. Modelo de 2B parámetros, 30 idiomas, Diseño de Voz, clonación de voz controlable, audio 48kHz de calidad de estudio.

Compartir esta herramienta

Nuestro Veredicto

Vale la Pena Probar

Un avance TTS sin tokenizador de OpenBMB — 30 idiomas, diseño de voz y salida 48kHz, pero requiere GPU potente.

VoxCPM2 representa un avance significativo en TTS de código abierto: su arquitectura autorregresiva de difusión sin tokenizador produce voz más natural que las alternativas de tokens discretos, y el modelo único que cubre 30 idiomas con detección automática es impresionante. La función de Diseño de Voz (crear una voz desde una descripción de texto) y la Clonación Definitiva (reproducir cada matiz del audio de referencia + transcripción) son capacidades genuinamente útiles.\n\nAdvertencias: la inferencia en tiempo real necesita una GPU clase RTX 4090, la documentación está dispersa y los 101 issues abiertos sugieren desarrollo continuo. Para investigadores, creadores de contenido y desarrolladores que necesitan TTS multilingüe de alta calidad con capacidades de diseño de voz, VoxCPM2 es una opción convincente de código abierto.

Ideal para

  • Investigadores, creadores de contenido y desarrolladores que necesiten TTS multilingüe de alta calidad con diseño y clonación de voz, y tengan acceso a una GPU potente (RTX 4090 o superior).

Considera alternativas si

  • Si no tienes una GPU potente, considera APIs TTS en la nube (ElevenLabs, OpenAI TTS) o modelos open source ligeros que funcionen en CPU.

Plataformas compatibles

Aplicación webWindowsmacOSLinuxAPI

Las plataformas disponibles incluyen Aplicación web, Windows, macOS, Linux y API.

Características Principales

Arquitectura sin tokenizador: genera directamente representaciones continuas de voz mediante modelo autoregresivo de difusión
Modelo de 2 mil millones de parámetros (VoxCPM2) entrenado con 2M+ horas de datos multilingües
30 idiomas compatibles — sin necesidad de etiqueta de idioma, detección automática
Diseño de Voz: crea una voz nueva desde una descripción en lenguaje natural (género, edad, tono, emoción, ritmo)
Clonación de Voz Controlable: clona cualquier voz con una muestra corta y guía de estilo
Clonación Definitiva: reproduce cada matiz vocal desde audio de referencia + transcripción
Audio 48kHz de calidad de estudio mediante AudioVAE V2 con superresolución integrada
Streaming en tiempo real: RTF tan bajo como ~0.3 en RTX 4090, ~0.13 con aceleración Nano-vLLM
Síntesis consciente del contexto: infiere automáticamente prosodia y expresividad del texto
Construido sobre la columna vertebral MiniCPM-4 de OpenBMB

Precios

free
Gratuito y de código abierto (Apache 2.0). Pesos del modelo disponibles en Hugging Face y ModelScope.

Casos de Uso

TTS multilingüe para creación de contenido, doblaje y accesibilidad
Diseño de voz para asistentes virtuales, personajes de juegos y voces de marca
Clonación de voz de alta fidelidad para aplicaciones de voz personalizadas

Ventajas

Arquitectura sin tokenizador produce voz más natural y expresiva que TTS de tokens discretos
30 idiomas en un solo modelo con detección automática de idioma
Diseño de Voz desde descripción en lenguaje natural — sin audio de referencia
Salida 48kHz de calidad de estudio con superresolución integrada
Licencia Apache 2.0, del reputado equipo OpenBMB (Universidad de Tsinghua)

Desventajas

Requiere recursos GPU significativos (RTX 4090 recomendada) para inferencia en tiempo real
101 issues abiertos en el momento de la verificación
Documentación dispersa entre GitHub, ReadTheDocs y Hugging Face
Último push hace 35 días — nivel de actividad moderado

Última Actualización

Julio 2026: VoxCPM2 lanzado con 2B parámetros, 30 idiomas, Diseño de Voz, clonación controlable, salida 48kHz y streaming en tiempo real.

Suscríbete a noticias de IA

Recibe las últimas recomendaciones de herramientas IA y análisis en tu correo.

Respetamos tu privacidad. Cancela cuando quieras.