Whisper
de OpenAI · github.com ↗
Modelo de reconocimiento automático de voz de código abierto de OpenAI para transcripción y traducción.
speech-to-text open-weights transcription
- Categoría
- Audio, voz y música
- Modelo de negocio
- Abierto (pesos/código abierto)
- Disponibilidad
- Global
- Lanzamiento
- 2022-09
- Registro actualizado
- 2026-07-27
- Licencia
- MIT
- Fundación
- 2015
- Sede
- US
Resumen
Whisper es el modelo de reconocimiento automático de voz de código abierto de OpenAI, lanzado en 2022 bajo licencia MIT. Transcribe y traduce voz en decenas de idiomas y puede ejecutarse localmente, lo que lo ha convertido en la opción predeterminada para transcripción en innumerables aplicaciones. El uso alojado también está disponible mediante la API de OpenAI.
Funciones principales
- ASR de código abierto bajo licencia MIT
- Transcripción en decenas de idiomas
- Traducción de voz al inglés
- Se ejecuta localmente o vía la API de OpenAI
Casos de uso
- Transcribir reuniones, pódcast y entrevistas
- Integrar funciones de voz en aplicaciones
- Transcripción sin conexión cuando importa la privacidad
Precios
El modelo es gratuito para descargar y autoalojar bajo MIT; la API alojada de OpenAI se cobra por minuto de audio.
Preguntas frecuentes
¿Whisper es gratis?
Sí. Whisper es de código abierto bajo licencia MIT y puede ejecutarse localmente sin costo; la API alojada se cobra por uso.
¿Qué idiomas admite Whisper?
Whisper transcribe voz en decenas de idiomas y puede traducir la voz al inglés.
¿Quién desarrolla Whisper?
Whisper fue desarrollado y publicado como código abierto por OpenAI en 2022.
Productos similares
- AIVA — Asistente de composición musical con IA que genera pistas originales en muchos estilos para proyectos multimedia.
- AssemblyAI — API de voz a texto que ofrece modelos de transcripción e inteligencia de audio para desarrolladores.
- Cartesia — Plataforma de generación de voz en tiempo real basada en modelos de espacio de estados para síntesis de voz de baja latencia.
- Deepgram — API de reconocimiento de voz e IA de voz para transcripción en tiempo real y comprensión de audio.
- Descript — Editor de audio y vídeo impulsado por IA que permite editar grabaciones editando su transcripción.
- ElevenLabs — Plataforma de voz con IA que ofrece texto a voz, clonación de voz y doblaje.
Todas las alternativas a Whisper → · Todos los productos de Audio, voz y música →
Fuentes
Este registro se revisó por última vez el 2026-07-27.
Registro legible por máquina: /api/products/whisper.json · ¿Detectaste un error? Sugerir una corrección