VoxCPM

VoxCPM

Audio et Voix
OpenBMB (Tsinghua University)
Open SourceGratuit

À Propos

Système TTS sans tokenizer d'OpenBMB : génère directement des représentations vocales continues via une architecture autorégressive de diffusion. Modèle de 2B paramètres, 30 langues, Conception Vocale, clonage vocal contrôlable, audio 48kHz qualité studio.

Partager cet outil

Notre Verdict

À Essayer

Une percée TTS sans tokenizer d'OpenBMB — 30 langues, conception vocale et sortie 48kHz, mais nécessite un GPU puissant.

VoxCPM2 représente une avancée significative dans le TTS open source : son architecture autorégressive de diffusion sans tokenizer produit une voix plus naturelle que les alternatives à tokens discrets, et le modèle unique couvrant 30 langues avec détection automatique est impressionnant. La fonction de Conception Vocale (créer une voix à partir d'une description textuelle) et le Clonage Ultime (reproduire chaque nuance de l'audio de référence + transcription) sont des capacités véritablement utiles.\n\nMises en garde : l'inférence en temps réel nécessite un GPU de classe RTX 4090, la documentation est dispersée et les 101 issues ouvertes suggèrent un développement continu. Pour les chercheurs, créateurs de contenu et développeurs qui ont besoin d'un TTS multilingue de haute qualité avec des capacités de conception vocale, VoxCPM2 est une option open source convaincante.

Idéal pour

  • Chercheurs, créateurs de contenu et développeurs ayant besoin d'un TTS multilingue de haute qualité avec conception et clonage vocal, et disposant d'un GPU puissant (RTX 4090 ou supérieur).

Envisagez des alternatives si

  • Si vous n'avez pas de GPU puissant, envisagez des API TTS cloud (ElevenLabs, OpenAI TTS) ou des modèles open source plus légers fonctionnant sur CPU.

Plateformes prises en charge

Application webWindowsmacOSLinuxAPI

Les plateformes disponibles incluent Application web, Windows, macOS, Linux et API.

Fonctionnalités Clés

Architecture sans tokenizer : génère directement des représentations vocales continues via un modèle autorégressif de diffusion
Modèle de 2 milliards de paramètres (VoxCPM2) entraîné sur 2M+ heures de données multilingues
30 langues prises en charge — sans étiquette de langue, détection automatique
Conception Vocale : crée une voix entièrement nouvelle à partir d'une description en langage naturel
Clonage Vocal Contrôlable : clonez n'importe quelle voix à partir d'un court extrait avec guidage de style
Clonage Ultime : reproduit chaque nuance vocale à partir de l'audio de référence + transcription
Audio 48kHz qualité studio via AudioVAE V2 avec super-résolution intégrée
Streaming en temps réel : RTF aussi bas que ~0,3 sur RTX 4090, ~0,13 avec accélération Nano-vLLM
Synthèse contextuelle : infère automatiquement la prosodie et l'expressivité du texte
Construit sur le backbone MiniCPM-4 d'OpenBMB

Tarifs

free
Gratuit et open source (Apache 2.0). Les poids du modèle sont disponibles sur Hugging Face et ModelScope.

Cas d'Utilisation

TTS multilingue pour la création de contenu, le doublage et l'accessibilité
Conception vocale pour assistants virtuels, personnages de jeux et voix de marque
Clonage vocal haute fidélité pour des applications vocales personnalisées

Avantages

L'architecture sans tokenizer produit une voix plus naturelle et expressive que le TTS à tokens discrets
30 langues dans un seul modèle avec détection automatique de la langue
Conception Vocale à partir d'une description en langage naturel — aucun audio de référence requis
Sortie 48kHz qualité studio avec super-résolution intégrée
Licence Apache 2.0, de la réputée équipe OpenBMB (Université Tsinghua)

Inconvénients

Nécessite des ressources GPU importantes (RTX 4090 recommandée) pour l'inférence en temps réel
101 issues ouvertes au moment de la vérification
Documentation dispersée entre GitHub, ReadTheDocs et Hugging Face
Dernier push il y a 35 jours — niveau d'activité modéré

Dernière Mise à Jour

Juillet 2026 : VoxCPM2 publié avec 2B paramètres, 30 langues, Conception Vocale, clonage contrôlable, sortie 48kHz et streaming en temps réel.

S'abonner aux actualités IA

Recevez les dernières recommandations d'outils IA et analyses dans votre boîte mail.

Nous respectons votre vie privée. Désabonnement à tout moment.