
VoxCPM
概要
OpenBMBのトークナイザーフリーTTSシステム。拡散自己回帰アーキテクチャにより連続音声表現を直接生成。2Bパラメータモデル、30言語、音声デザイン、制御可能な音声クローン、48kHzスタジオ品質オーディオ。
編集部評価
試す価値ありOpenBMBによるトークナイザーフリーTTSのブレイクスルー——30言語、音声デザイン、48kHz出力。ただしGPU負荷が高い。
VoxCPM2は、オープンソースTTSにおける重要な進歩を表しています:トークナイザーフリーの拡散自己回帰アーキテクチャは、離散トークン方式よりも自然な音声を生成し、30言語をカバーする単一モデルと自動検出は印象的です。音声デザイン機能(テキスト説明から声を作成)と究極のクローン(参照音声+テキストからすべてのニュアンスを再現)は真に有用な機能です。\n\n注意点:リアルタイム推論にはRTX 4090クラスのGPUが必要で、ドキュメントは分散しており、101件の未解決issueは開発が継続中であることを示しています。高品質な多言語TTSと音声デザイン機能を必要とする研究者、コンテンツ制作者、開発者にとって、VoxCPM2は魅力的なオープンソースの選択肢です。
最適なユーザー
- •高品質な多言語TTSと音声デザイン・クローン機能を必要とし、強力なGPU(RTX 4090以上)を利用できる研究者、コンテンツ制作者、開発者。
代替を検討すべき場合
- •強力なGPUがない場合は、クラウドベースのTTS API(ElevenLabs、OpenAI TTS)やCPUで動作する軽量オープンソースモデルを検討してください。
対応プラットフォーム
利用可能なプラットフォーム:Webアプリ、Windows、macOS、Linux、API。
主な機能
料金
活用シーン
メリット
デメリット
最新情報
2026年7月:VoxCPM2リリース。2Bパラメータ、30言語、音声デザイン、制御可能クローン、48kHz出力、リアルタイムストリーミング。
関連ツール(音声&スピーチ)
リーディングなAI音声合成・クローンプラットフォーム。多言語対応
OpenAIのオープンソース音声認識モデル。多言語の音声テキスト変換をサポート
オープンソースTTSの雄Fish Speechチームによる音声生成プラットフォーム。10〜30秒のサンプルで声をクローンでき、S1/S2モデルは自然で表現豊かな音声を実現。商用利用と従量課金APIに対応
MiniMax傘下の音声生成プラットフォーム。Speechシリーズモデルは40以上の言語で超リアルなTTSと約10秒のサンプルによる声のクローンに対応。感情や効果音タグの制御が可能で、Web版は無料で試用できる