Whisper
par OpenAI · github.com ↗
Modèle de reconnaissance automatique de la parole open source d'OpenAI pour la transcription et la traduction.
speech-to-text open-weights transcription
- Catégorie
- Audio, voix et musique
- Modèle économique
- Ouvert (poids/source ouverts)
- Disponibilité
- Mondial
- Lancement
- 2022-09
- Enregistrement mis à jour
- 2026-07-27
- Licence
- MIT
- Création
- 2015
- Siège
- US
Aperçu
Whisper est le modèle open source de reconnaissance automatique de la parole d'OpenAI, publié en 2022 sous licence MIT. Il transcrit et traduit la parole dans des dizaines de langues et peut tourner en local, ce qui en a fait le choix par défaut pour la transcription dans d'innombrables applications. Un usage hébergé est aussi disponible via l'API d'OpenAI.
Fonctionnalités clés
- ASR open source sous licence MIT
- Transcription dans des dizaines de langues
- Traduction de la parole vers l'anglais
- Exécution locale ou via l'API d'OpenAI
Cas d'usage
- Transcrire réunions, podcasts et interviews
- Intégrer des fonctions vocales dans des applications
- Transcription hors ligne quand la confidentialité compte
Tarifs
Le modèle est gratuit à télécharger et à auto-héberger sous MIT ; l'API hébergée d'OpenAI est facturée à la minute d'audio.
Questions fréquentes
Whisper est-il gratuit ?
Oui. Whisper est open source sous licence MIT et peut tourner en local sans coût ; l'API hébergée est facturée à l'usage.
Quelles langues Whisper prend-il en charge ?
Whisper transcrit la parole dans des dizaines de langues et peut la traduire vers l'anglais.
Qui développe Whisper ?
Whisper a été développé et publié en open source par OpenAI en 2022.
Produits similaires
- AIVA — Assistant de composition musicale par IA qui génère des morceaux originaux dans de nombreux styles pour des projets médias.
- AssemblyAI — API de reconnaissance vocale offrant aux développeurs des modèles de transcription et d'intelligence audio.
- Cartesia — Plateforme de génération vocale en temps réel basée sur des modèles à espace d'états pour une synthèse vocale à faible latence.
- Deepgram — API de reconnaissance vocale et d'IA vocale pour la transcription en temps réel et la compréhension audio.
- Descript — Éditeur audio et vidéo propulsé par l'IA qui permet de monter des enregistrements en modifiant leur transcription.
- ElevenLabs — Plateforme vocale d'IA proposant la synthèse vocale, le clonage de voix et le doublage.
Toutes les alternatives à Whisper → · Tous les produits Audio, voix et musique →
Sources
Cet enregistrement a été vérifié pour la dernière fois le 2026-07-27.
Enregistrement lisible par machine : /api/products/whisper.json · Une erreur ? Suggérer une correction