Содержание
OpenAI превратила голосовой интерфейс в полноценного AI-агента
OpenAI выпустила сразу три аудиомодели для Realtime API. GPT‑Realtime‑2 ведёт естественный разговор, рассуждает и вызывает инструменты; GPT‑Realtime‑Translate переводит живую речь; GPT‑Realtime‑Whisper превращает её в текст по мере того, как говорит пользователь.
Что умеет GPT‑Realtime‑2
Главная модель релиза получила рассуждения уровня GPT‑5, параллельный вызов инструментов и контекст до 128 тысяч токенов вместо прежних 32 тысяч. Она лучше запоминает термины и имена, умеет менять тон ответа, спокойно обрабатывать перебивания и проговаривать, какое действие выполняет прямо сейчас.
Для разработчиков это означает переход от простого голосового чат-бота к агенту, который способен проверить календарь, найти информацию, оформить действие и продолжить разговор без длинной паузы. Уровень рассуждений можно настраивать от minimal до xhigh, балансируя скорость и сложность задачи.
Перевод и расшифровка без ожидания
GPT‑Realtime‑Translate принимает более 70 языков и переводит речь в 13 языков практически синхронно, сохраняя темп собеседника. Модель рассчитана на поддержку клиентов, международные продажи, обучение, трансляции и локализацию контента в реальном времени.
GPT‑Realtime‑Whisper создаёт потоковую расшифровку прямо во время разговора. На её основе можно делать живые субтитры, заметки со встреч, протоколы звонков и автоматические сценарии для продаж, рекрутинга и поддержки.
Почему релиз важен бизнесу и креаторам
Все три модели уже доступны в Realtime API. Это заметно снижает порог для продуктов, где голос становится основным интерфейсом: от многоязычных эфиров и интерактивных видео до ассистентов, которые не только отвечают, но и выполняют задачи в ходе разговора.