Whisper
제공: OpenAI · github.com ↗
전사와 번역을 위한 OpenAI의 오픈 소스 자동 음성 인식 모델.
speech-to-text open-weights transcription
- 카테고리
- 오디오·음성·음악
- 비즈니스 모델
- 오픈(오픈 가중치/소스)
- 이용 가능성
- 글로벌
- 출시
- 2022-09
- 레코드 업데이트
- 2026-07-27
- 라이선스
- MIT
- 설립
- 2015
- 본사
- US
개요
Whisper는 2022년 MIT 라이선스로 공개된 OpenAI의 오픈 소스 자동 음성 인식 모델입니다. 수십 개 언어의 음성을 전사하고 번역하며 로컬에서 실행할 수 있어 수많은 애플리케이션에서 전사 기능의 기본 선택이 되었습니다. OpenAI API를 통한 호스팅 사용도 가능합니다.
주요 기능
- MIT 라이선스의 오픈 소스 ASR
- 수십 개 언어의 전사
- 음성을 영어로 번역
- 로컬 실행 또는 OpenAI API로 이용
활용 사례
- 회의, 팟캐스트, 인터뷰 전사
- 애플리케이션에 음성 기능 구축
- 개인정보가 중요한 오프라인 전사
가격
모델은 MIT 하에 무료로 다운로드하고 셀프 호스팅할 수 있으며, 호스팅된 OpenAI API는 오디오 분당 과금됩니다.
자주 묻는 질문
Whisper는 무료인가요?
네. Whisper는 MIT 라이선스의 오픈 소스로 무료로 로컬 실행할 수 있으며, 호스팅 API는 사용량 과금입니다.
Whisper는 어떤 언어를 지원하나요?
Whisper는 수십 개 언어의 음성을 전사하고 음성을 영어로 번역할 수 있습니다.
Whisper는 누가 개발했나요?
Whisper는 OpenAI가 개발해 2022년에 오픈 소스로 공개했습니다.
유사 제품
- AIVA — 미디어 프로젝트를 위해 다양한 스타일의 오리지널 트랙을 생성하는 AI 작곡 어시스턴트.
- AssemblyAI — 개발자를 위한 전사 및 오디오 인텔리전스 모델을 제공하는 음성-텍스트 변환 API.
- Cartesia — 저지연 음성 합성을 위해 상태공간 모델을 기반으로 구축한 실시간 음성 생성 플랫폼.
- Deepgram — 실시간 전사와 오디오 이해를 위한 음성 인식·보이스 AI API.
- Descript — 녹음물을 그 전사본을 편집하는 방식으로 수정할 수 있는 AI 기반 오디오·비디오 편집기.
- ElevenLabs — 텍스트 음성 변환, 음성 복제, 더빙을 제공하는 AI 음성 플랫폼.
출처
이 레코드는 2026-07-27에 마지막으로 검토되었습니다.
기계 판독용 레코드: /api/products/whisper.json · 오류를 발견하셨나요? 수정 제안