Whisper
来自 OpenAI · github.com ↗
OpenAI 的开源自动语音识别模型,用于转写与翻译。
speech-to-text open-weights transcription
- 分类
- 音频、语音与音乐
- 商业模式
- 开放(开放权重/源码)
- 可用性
- 全球
- 发布
- 2022-09
- 记录更新
- 2026-07-27
- 许可证
- MIT
- 成立时间
- 2015
- 总部所在地
- US
概述
Whisper 是 OpenAI 的开源自动语音识别模型,于 2022 年以 MIT 许可发布。它可转写并翻译数十种语言的语音,且可在本地运行,因而成为无数应用中转写功能的默认选择。也可通过 OpenAI API 使用托管版本。
主要功能
- MIT 许可下的开源语音识别
- 支持数十种语言的转写
- 语音到英语的翻译
- 可本地运行或通过 OpenAI API 调用
适用场景
- 转写会议、播客与访谈
- 在应用中构建语音功能
- 注重隐私的离线转写
定价
模型可在 MIT 许可下免费下载与自托管;托管的 OpenAI API 按音频分钟计费。
常见问题
Whisper 免费吗?
免费。Whisper 以 MIT 许可开源,可免费在本地运行;托管 API 按用量计费。
Whisper 支持哪些语言?
Whisper 可转写数十种语言的语音,并可将语音翻译为英语。
Whisper 由谁开发?
Whisper 由 OpenAI 开发并于 2022 年开源。
同类产品
- AIVA — AI 音乐创作助手,可为媒体项目生成多种风格的原创曲目。
- AssemblyAI — 语音转文本 API,为开发者提供转写与音频智能分析模型。
- Cartesia — 基于状态空间模型的实时语音生成平台,可实现低延迟语音合成。
- Deepgram — 语音识别与语音 AI 的 API,可用于实时转写与音频理解。
- Descript — 由 AI 驱动的音视频编辑器,可通过编辑文字稿的方式来剪辑录音与视频。
- ElevenLabs — 提供文本转语音、声音克隆与配音的 AI 语音平台。
来源
本记录最近复核于 2026-07-27。
机器可读记录:/api/products/whisper.json · 发现错误?提交纠错