Содержание
OpenAI обновила распознавание речи: две модели для записей и прямых эфиров
OpenAI добавила в API две новые модели распознавания речи. GPT Transcribe предназначена для готовых аудиофайлов и потоковой выдачи текста во время обработки записи, а GPT Live Transcribe — для живого звука с низкой задержкой: звонков, микрофона, интервью и трансляций.
Что умеют новые модели
Обе модели принимают дополнительный контекст, ключевые слова и подсказки по нескольким языкам. Это помогает точнее распознавать названия брендов, имена, профессиональные термины и речь с переключением между языками. Для GPT Live Transcribe также можно настраивать баланс между задержкой и скоростью появления текста.
GPT Transcribe работает с завершёнными файлами через API транскрибации и может использоваться в Realtime-сессиях для отдельных завершённых реплик. GPT Live Transcribe рассчитана именно на постоянный поток аудио и возвращает фрагменты расшифровки по мере речи.
Сколько стоит расшифровка
По официальной документации OpenAI, GPT Transcribe стоит $0,0045 за минуту аудио, а GPT Live Transcribe — $0,017 за минуту. Старые модели GPT-4o Transcribe, GPT-4o Mini Transcribe и GPT Realtime Whisper продолжат работать, но для новых интеграций OpenAI рекомендует начинать с новых вариантов.
Что это даёт авторам и бизнесу
Новые модели можно использовать для автоматической расшифровки подкастов, интервью, уроков, созвонов и пользовательских видео. Контекст и список ключевых слов особенно полезны там, где обычное распознавание часто ошибается в названиях продуктов, фамилиях или отраслевой лексике.
При этом для субтитров с точными временными метками, форматов SRT и VTT OpenAI пока рекомендует Whisper-1, а для разделения реплик по спикерам — GPT-4o Transcribe Diarize. Поэтому выбор модели зависит не только от качества текста, но и от того, нужны ли таймкоды и распознавание участников разговора.