VoxCPM

VoxCPM

音声&スピーチ
OpenBMB (Tsinghua University)
オープンソース無料

概要

OpenBMBのトークナイザーフリーTTSシステム。拡散自己回帰アーキテクチャにより連続音声表現を直接生成。2Bパラメータモデル、30言語、音声デザイン、制御可能な音声クローン、48kHzスタジオ品質オーディオ。

このツールを共有
Twitter LinkedIn Facebook

編集部評価

試す価値あり

OpenBMBによるトークナイザーフリーTTSのブレイクスルー——30言語、音声デザイン、48kHz出力。ただしGPU負荷が高い。

VoxCPM2は、オープンソースTTSにおける重要な進歩を表しています:トークナイザーフリーの拡散自己回帰アーキテクチャは、離散トークン方式よりも自然な音声を生成し、30言語をカバーする単一モデルと自動検出は印象的です。音声デザイン機能(テキスト説明から声を作成)と究極のクローン(参照音声+テキストからすべてのニュアンスを再現)は真に有用な機能です。\n\n注意点:リアルタイム推論にはRTX 4090クラスのGPUが必要で、ドキュメントは分散しており、101件の未解決issueは開発が継続中であることを示しています。高品質な多言語TTSと音声デザイン機能を必要とする研究者、コンテンツ制作者、開発者にとって、VoxCPM2は魅力的なオープンソースの選択肢です。

最適なユーザー

  • 高品質な多言語TTSと音声デザイン・クローン機能を必要とし、強力なGPU(RTX 4090以上)を利用できる研究者、コンテンツ制作者、開発者。

代替を検討すべき場合

  • 強力なGPUがない場合は、クラウドベースのTTS API(ElevenLabs、OpenAI TTS)やCPUで動作する軽量オープンソースモデルを検討してください。

対応プラットフォーム

WebアプリWindowsmacOSLinuxAPI

利用可能なプラットフォーム:Webアプリ、Windows、macOS、Linux、API。

主な機能

トークナイザーフリーアーキテクチャ:拡散自己回帰モデルで連続音声表現を直接生成
20億パラメータモデル(VoxCPM2)、200万時間以上の多言語音声データで学習
30言語対応——言語タグ不要、入力テキストから自動検出
音声デザイン:自然言語の説明だけで全新の声を作成(性別、年齢、トーン、感情、ペース)
制御可能な音声クローン:短い参照クリップから任意の声をクローン、スタイルガイダンス対応
究極のクローン:参照音声+テキストからすべての声のニュアンスを再現
AudioVAE V2による48kHzスタジオ品質オーディオ出力、内蔵超解像
リアルタイムストリーミング:RTX 4090でRTF ~0.3、Nano-vLLM加速で~0.13
文脈認識合成:テキスト内容から自動的に韻律と表現力を推論
OpenBMB MiniCPM-4 バックボーンをベース

料金

free
無料のオープンソース(Apache 2.0)。モデルウェイトはHugging FaceとModelScopeで入手可能。

活用シーン

コンテンツ制作、吹き替え、アクセシビリティのための多言語TTS
バーチャルアシスタント、ゲームキャラクター、ブランドボイスの音声デザイン
パーソナライズされた音声アプリケーションのための高忠実度音声クローン

メリット

トークナイザーフリーアーキテクチャにより、離散トークンTTSよりも自然で表現力豊かな音声を生成
1モデルで30言語対応、自動言語検出
自然言語の説明から音声デザイン——参照音声不要
48kHzスタジオ品質出力、内蔵超解像
Apache 2.0ライセンス、評価の高いOpenBMBチーム(清華大学)

デメリット

リアルタイム推論には強力なGPU(RTX 4090推奨)が必要
検証時点で101件の未解決issue
ドキュメントがGitHub、ReadTheDocs、HuggingFaceに分散
最終プッシュから35日——中程度の活動レベル

最新情報

2026年7月:VoxCPM2リリース。2Bパラメータ、30言語、音声デザイン、制御可能クローン、48kHz出力、リアルタイムストリーミング。

AIニュースを購読

最新のAIツール推薦、業界動向、深層分析をお届けします。

プライバシーを尊重します。いつでも購読解除できます。