OpenAI выпустила две новые модели распознавания речи: GPT Transcribe для обработки аудиофайлов и GPT Live Transcribe для потоковой расшифровки речи с низкой задержкой. Обе модели уже доступны через API и ориентированы на разработчиков, которым нужны мультиязычное распознавание, учет текстового контекста и работа в реальном времени.
GPT Transcribe: быстрее офлайн-расшифровки
GPT Transcribe предназначена для пакетной обработки аудио и видеофайлов. По данным OpenAI, модель способна обрабатывать записи примерно в 34 раза быстрее реального времени, что делает ее удобной для транскрибации интервью, подкастов, лекций и корпоративных архивов. Она поддерживает учет предварительного текстового контекста и списка ключевых слов, что помогает точнее распознавать профессиональную терминологию, имена и названия компаний.
GPT Live Transcribe: ставка на низкую задержку
Вторая модель — GPT Live Transcribe — оптимизирована для потокового распознавания речи. Она предназначена для голосовых интерфейсов, звонков, видеоконференций и других сценариев, где критична минимальная задержка между произнесенной фразой и появлением текста. Модель также поддерживает мультиязычный ввод и контекстные подсказки.
Что показывают тесты
По данным Artificial Analysis, GPT Transcribe демонстрирует уровень ошибок в словах (WER) 3,3% на бенчмарке AA-WER, что примерно на 0,7 процентного пункта лучше, чем у GPT-4o Transcribe. В общем рейтинге модель пока не занимает первое место.
|
Модель |
WER |
|
Alibaba Fun-Realtime-ASR-Preview |
1,7% |
|
ElevenLabs Scribe v2 |
2,2% |
|
Microsoft MAI-Transcribe-1.5 |
2,4% |
|
Mistral Voxtral Small |
2,8% |
|
Gemini 3.1 Pro |
2,8% |
|
OpenAI GPT Transcribe |
3,3% |
OpenAI заметно улучшила собственные модели распознавания речи, но по текущим независимым оценкам они все еще уступают лидерам рынка.
GPT Transcribe стоит $0,0045 за минуту аудио, а GPT Live Transcribe — $0,017 за минуту. Модели стали заметно дешевле.
ссылка на оригинал статьи https://habr.com/ru/articles/1064894/