Содержание
NVIDIA выпустила открытую модель для голосовых AI-агентов
NVIDIA опубликовала на Hugging Face веса NemotronLabs VoiceChat 11B — голосовой AI-модели, которая одновременно понимает речь и генерирует ответ. В отличие от привычной связки распознавания речи, языковой модели и синтеза голоса, здесь весь разговор обрабатывает единая архитектура. Это сокращает задержку и делает общение с агентом более естественным.
Разговор без строгой очереди реплик
Модель работает в полнодуплексном режиме: пользователь может перебить ассистента, а тот должен сразу уступить ему слово. NVIDIA указывает среднюю задержку смены реплик около 450 мс. NemotronLabs VoiceChat занимает второе место среди открытых полнодуплексных моделей в VoiceBench и Full-Duplex-Bench 1.0.
В основе системы — 11 млрд параметров и гибридная архитектура Mamba/Transformer. Она принимает текст и аудио, а на выходе даёт текст ответа, голос и расшифровку пользовательской речи. Для работы в реальном времени NVIDIA предлагает развёртывание через vLLM и WebSocket на GPU компании.
Голосовой агент может вызывать инструменты
Главное отличие релиза — отдельный канал для вызова функций. По данным NVIDIA, это первая открытая полнодуплексная голосовая модель, которая умеет обращаться к инструментам и при этом сохранять естественный ход разговора. Пока выполняется действие, агент может произнести заранее заданную фразу ожидания, а затем продолжить диалог с результатом.
Для разработчиков это основа для голосовых операторов, помощников и корпоративных агентов, которые не только отвечают, но и проверяют данные, запускают процессы или работают с внешними сервисами. Важно учитывать ограничения: текущая версия ориентирована на английский язык, требует мощного NVIDIA GPU и опубликована для исследовательского использования по лицензии OpenMDW 1.1.
Что это меняет для бизнеса и авторов
Открытые веса дают командам возможность тестировать голосовой интерфейс внутри собственной инфраструктуры и глубже контролировать данные. Для контентных проектов это может ускорить создание интерактивных голосовых персонажей, обучающих помощников и сценариев поддержки, но до массового локального запуска модель пока далека из-за размера и требований к железу.