Whisper

Whisper

音频与语音
OpenAI
免费开源

关于

OpenAI 开源的语音识别模型,支持多语言语音转文字

分享此工具

编辑评价

推荐

OpenAI的开源语音转文字模型——准确、多语言、可免费本地运行。

Whisper 为开源语音识别设定了新标准。它在多语言、带口音语音和噪声环境中表现出色。因为开源,你可以本地运行保证隐私,集成到自定义管道中,或通过API使用——专有方案不具备的灵活性。

对于实时转录或生产级部署,你可能需要探索 faster-whisper 等优化实现。但作为平衡准确性、语言覆盖和可获取性的基准转录模型,Whisper 仍是参考标准。

最适合

  • 离线/本地语音转文字
  • 多语言音频转录项目
  • 自定义语音处理管道

以下情况建议考虑替代方案

  • 需要实时流式转录(→ Deepgram、AssemblyAI)
  • 需要转录之外的完整音视频编辑(→ Descript)

平台支持

WindowsmacOSLinuxAPI

可用平台包括Windows、macOS、Linux和API。

核心功能

开源语音识别
large-v3 模型,支持 99 种语言
语音转文字与翻译
抗噪声与口音能力强
支持本地与 API 部署
可免费商用

广告

定价方案

free
开源,可免费自托管
api
OpenAI API $0.006/分钟
providers
第三方托管约 $0.22/小时起

使用场景

音视频转写
字幕生成
会议与访谈记录
多语言翻译
语音交互后端
无障碍字幕

优点

免费且开源
多语言识别准确
可本地部署保护隐私
抗噪声能力强

缺点

加速需 GPU
无官方实时界面
需一定技术部署

最新动态

2026年7月:Whisper large-v3 仍是领先的开源 ASR 模型,支持 99 种语言且被广泛托管

订阅 AI 资讯

获取最新 AI 工具推荐、行业动态和深度分析,每周精选直达邮箱。

我们尊重你的隐私,随时可以取消订阅。