НовостьНейросетиOpenAIРаспознавание речи

OpenAI выпустила GPT Transcribe и GPT Live Transcribe для расшифровки аудио

OpenAI представила две новые speech-to-text модели: GPT Transcribe для файлов и GPT Live Transcribe для потоковой расшифровки речи в реальном времени.

Кирилл Киреев

29.07.2026 · 3 минут чтения · Нейросети

OpenAI выпустила GPT Transcribe и GPT Live Transcribe для расшифровки аудио cover

Содержание

OpenAI обновила распознавание речи: две модели для записей и прямых эфиров

OpenAI добавила в API две новые модели распознавания речи. GPT Transcribe предназначена для готовых аудиофайлов и потоковой выдачи текста во время обработки записи, а GPT Live Transcribe — для живого звука с низкой задержкой: звонков, микрофона, интервью и трансляций.

Что умеют новые модели

Обе модели принимают дополнительный контекст, ключевые слова и подсказки по нескольким языкам. Это помогает точнее распознавать названия брендов, имена, профессиональные термины и речь с переключением между языками. Для GPT Live Transcribe также можно настраивать баланс между задержкой и скоростью появления текста.

GPT Transcribe работает с завершёнными файлами через API транскрибации и может использоваться в Realtime-сессиях для отдельных завершённых реплик. GPT Live Transcribe рассчитана именно на постоянный поток аудио и возвращает фрагменты расшифровки по мере речи.

Сколько стоит расшифровка

По официальной документации OpenAI, GPT Transcribe стоит $0,0045 за минуту аудио, а GPT Live Transcribe — $0,017 за минуту. Старые модели GPT-4o Transcribe, GPT-4o Mini Transcribe и GPT Realtime Whisper продолжат работать, но для новых интеграций OpenAI рекомендует начинать с новых вариантов.

Что это даёт авторам и бизнесу

Новые модели можно использовать для автоматической расшифровки подкастов, интервью, уроков, созвонов и пользовательских видео. Контекст и список ключевых слов особенно полезны там, где обычное распознавание часто ошибается в названиях продуктов, фамилиях или отраслевой лексике.

При этом для субтитров с точными временными метками, форматов SRT и VTT OpenAI пока рекомендует Whisper-1, а для разделения реплик по спикерам — GPT-4o Transcribe Diarize. Поэтому выбор модели зависит не только от качества текста, но и от того, нужны ли таймкоды и распознавание участников разговора.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости