
Voicebox
概要
ローカルで動作するオープンソースAI音声スタジオ。音声クローン、7つのTTSエンジンによる音声合成、ディクテーション、エージェント音声を1つのアプリで実現。ElevenLabsとWisprFlowの無料代替。23言語対応。
編集部評価
強くおすすめオープンソース音声AIの新たなスタンダード
Voiceboxは、わずか6ヶ月で48k+のGitHubスターを獲得し、2026年で最も印象的なオープンソースAIプロジェクトの1つになりました。音声クローン、7つのTTSエンジン、MCPエージェント統合、ローカルファーストアーキテクチャの組み合わせは真にユニークです。単一メンテナーリスクや一部のWindows GPU問題は実際の懸念事項ですが、開発ペースとコミュニティの対応は卓越しています。
最適なユーザー
- •無料のローカル音声クローンを求めるコンテンツクリエイター
- •AIエージェントワークフローに音声を統合する開発者
- •クラウドTTSサービスを避けたいプライバシー重視のユーザー
代替を検討すべき場合
- •ゼロセットアップのクラウドTTSが必要(ElevenLabs)
- •音声出力ではなく入力のみが必要(WisprFlow)
対応プラットフォーム
利用可能なプラットフォーム:Windows、macOS、Linux、API。
主な機能
料金
活用シーン
メリット
デメリット
最新情報
2026年8月:v0.5.0リリース、48k+ GitHubスター、150万+ダウンロード
4ステップで始める
5 ステップで設定完了
4ステップで始める
5 ステップで設定完了
Voiceboxをダウンロード
GitHubから最新リリースをダウンロード(macOS、Windows、Linux)。
https://github.com/jamiepine/voicebox/releases声をクローンまたは選択
音声ファイルをインポート、マイクから録音、またはシステム音声をキャプチャ。3秒からクローン可能。
音声を生成
テキストを入力しTTSエンジンを選択。7つのエンジンをサポート。
curl -X POST http://127.0.0.1:17493/generate ...MCPでAIエージェントに接続
MCP設定にVoiceboxを追加して、クローンした声でAIエージェントが話せるように。
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp"
}
}
}関連ツール(音声&スピーチ)
リーディングなAI音声合成・クローンプラットフォーム。多言語対応
OpenAIのオープンソース音声認識モデル。多言語の音声テキスト変換をサポート
オープンソースTTSの雄Fish Speechチームによる音声生成プラットフォーム。10〜30秒のサンプルで声をクローンでき、S1/S2モデルは自然で表現豊かな音声を実現。商用利用と従量課金APIに対応
MiniMax傘下の音声生成プラットフォーム。Speechシリーズモデルは40以上の言語で超リアルなTTSと約10秒のサンプルによる声のクローンに対応。感情や効果音タグの制御が可能で、Web版は無料で試用できる