Содержание
Dialog-RSN-1 объединяет понимание речи, управление диалогом и вызов функций
PolyAI представила Dialog-RSN-1 — голосовую AI-модель для контакт-центров, которая получает не готовую расшифровку, а исходное аудио разговора. Благодаря этому система учитывает интонацию, паузы, сомнение, шум на линии и другие сигналы, которые обычно теряются при преобразовании речи в текст.
Что изменилось в голосовых AI-агентах
Традиционные голосовые боты работают как цепочка из распознавания речи, языковой модели и синтеза голоса. Dialog-RSN-1 объединяет определение момента окончания реплики, распознавание, рассуждение, вызов функций и подготовку ответа в одной аудио-ориентированной модели. Синтез речи при этом остаётся отдельным, поэтому компания может выбирать голос и управлять произношением названий и терминов.
Первый токен модели определяет состояние разговора: пользователь ещё не начал говорить, продолжает фразу или уже закончил. Это позволяет агенту не отвечать на середине номера заказа, не перебивать во время паузы и, наоборот, быстро вступать в разговор, когда реплика завершена. Поведение можно дополнительно задавать обычными инструкциями.
Задержка менее 300 мс и первые результаты
PolyAI заявляет целевую задержку менее 300 мс на GPU A100. Модель запускается по запросу в нужные моменты разговора, а не держит вычислительный поток постоянно активным. В одном из внедрений доля звонков, полностью решённых без перевода на человека, выросла на 11%, а у страховой компании задержка ответа снизилась на 37%.
Кому доступна Dialog-RSN-1
Модель уже обрабатывает реальные звонки в продуктивных системах PolyAI. Существующие клиенты могут включить её сейчас, а новым компаниям доступна заявка на ранний доступ. Открытых весов и публичного API пока нет, а на старте поддерживается только английский язык.
Для бизнеса релиз показывает практическое направление развития голосовых AI-агентов: вместо идеальной расшифровки они смогут понимать сам разговор и естественнее обслуживать клиентов. Это особенно важно для бронирований, поддержки, платежей и сценариев, где одна пауза или неверно услышанная цифра меняет результат звонка.