Whisper
提供: OpenAI · github.com ↗
文字起こしと翻訳のための、OpenAI のオープンソース自動音声認識モデル。
speech-to-text open-weights transcription
- カテゴリ
- オーディオ・音声・音楽
- ビジネスモデル
- オープン(オープンウェイト/ソース)
- 提供状況
- グローバル
- 公開
- 2022-09
- レコード更新
- 2026-07-27
- ライセンス
- MIT
- 設立
- 2015
- 本社所在地
- US
概要
Whisper は OpenAI のオープンソース自動音声認識モデルで、2022 年に MIT ライセンスで公開されました。数十の言語の音声を文字起こし・翻訳でき、ローカル実行も可能なため、無数のアプリで文字起こしのデフォルトの選択肢となっています。OpenAI API 経由のホスティング利用も可能です。
主な機能
- MIT ライセンスのオープンソース ASR
- 数十の言語に対応する文字起こし
- 音声から英語への翻訳
- ローカル実行または OpenAI API 経由で利用
ユースケース
- 会議・ポッドキャスト・インタビューの文字起こし
- アプリへの音声機能の組み込み
- プライバシー重視のオフライン文字起こし
料金
モデルは MIT の下で無料でダウンロード・セルフホストできます。ホスティング版 OpenAI API は音声 1 分単位の課金です。
よくある質問
Whisper は無料ですか?
はい。Whisper は MIT ライセンスのオープンソースで、無料でローカル実行できます。ホスティング API は従量課金です。
Whisper はどの言語に対応していますか?
Whisper は数十の言語の音声を文字起こしでき、音声を英語に翻訳できます。
Whisper は誰が開発しましたか?
Whisper は OpenAI が開発し、2022 年にオープンソース化しました。
類似製品
- AIVA — メディア制作向けに、さまざまなスタイルのオリジナル曲を生成する AI 作曲アシスタント。
- AssemblyAI — 開発者向けに文字起こしと音声インテリジェンスのモデルを提供する音声認識API。
- Cartesia — 状態空間モデルを基盤とし、低遅延の音声合成を実現するリアルタイム音声生成プラットフォーム。
- Deepgram — リアルタイム文字起こしと音声理解のための音声認識・音声AI API。
- Descript — 文字起こしを編集することで録音・録画を編集できる、AI搭載の音声・動画エディタ。
- ElevenLabs — テキスト読み上げ、ボイスクローン、吹き替えを提供するAI音声プラットフォーム。
出典
このレコードは 2026-07-27 に最終確認されました。
機械可読レコード: /api/products/whisper.json · 誤りを見つけましたか? 修正を提案