Whisper
音声&スピーチ
OpenAI
FreeOpen Source
概要
OpenAIのオープンソース音声認識モデル。多言語の音声テキスト変換をサポート
主な機能
オープンソースの音声認識
large-v3 モデル、99言語対応
音声のテキスト化と翻訳
ノイズやアクセントに強い
ローカル・API での展開
商用利用も無料
料金
free
オープンソース、無料セルフホスト可
api
OpenAI API 1分あたり$0.006
providers
サードパーティホスティング 約$0.22/時間〜
活用シーン
音声・動画の文字起こし
字幕生成
会議・インタビューの記録
多言語翻訳
音声インターフェースのバックエンド
アクセシビリティ用字幕
メリット
無料かつオープンソース
多言語で高い精度
プライバシー保護のためのローカル展開
ノイズに強い
デメリット
高速化には GPU が必要
公式のリアルタイム UI がない
技術的なセットアップが必要
最新情報
2026年7月:Whisper large-v3 は 99言語対応と幅広いプロバイダーによるホスティングで、依然として主要なオープン ASR モデル