Содержание
NVIDIA Magpie TTS: открытая модель для быстрых многоязычных голосовых агентов
NVIDIA выпустила обновлённую Magpie TTS Multilingual — модель синтеза речи с открытыми весами для голосовых ассистентов и других разговорных AI-продуктов. Она поддерживает 12 языков и может работать на собственной инфраструктуре компании, без передачи аудио во внешний облачный сервис.
Что появилось в новой версии
К английскому, испанскому, французскому, немецкому, итальянскому, вьетнамскому, китайскому, хинди и японскому добавились литературный арабский, корейский и бразильский португальский. Для каждого языка доступны мужские и женские голоса. NVIDIA также улучшила качество французской и испанской речи и расширила смешивание языков для хинди и японского.
Модель содержит около 364 млн параметров. Открытые веса опубликованы на Hugging Face по NVIDIA Open Model License, а для промышленного запуска доступен оптимизированный контейнер NVIDIA NIM. Magpie можно дообучать под фирменный голос, имена, термины и профессиональную лексику.
Почему важна задержка в 32 мс
Главная метрика для голосового интерфейса — время до первого фрагмента аудио. По тестам NVIDIA, на ускорителе B200 Magpie начинает отдавать речь через 32 мс, на H100 — через 47 мс, на DGX Spark — через 53 мс, а на A100 — через 79 мс. Это серверные показатели самой TTS-части: распознавание речи и работа языковой модели добавят свою задержку.
Ускорение обеспечивают генерация сразу двух аудиокадров за шаг и дополнительный локальный трансформер, который сохраняет качество речи. На B200 при 64 одновременных потоках система показывает задержку 239 мс и производительность примерно в 320 раз быстрее реального времени.
Кому пригодится Magpie
Релиз ориентирован на голосовую поддержку клиентов, корпоративных помощников, медицинские сервисы, переводчиков и продукты с жёсткими требованиями к приватности. Для бизнеса ключевое преимущество — контроль над данными, голосами, произношением и скоростью. Для разработчиков NVIDIA опубликовала демонстрацию, модель, NIM-контейнер и готовый пример голосового агента Nemotron с распознаванием речи, LLM и возможностью перебивать ассистента во время ответа.