Содержание
Cartesia Sonic 3.6: новая голосовая AI-модель для озвучки и локализации
Cartesia представила Sonic 3.6 — новую версию своей AI-модели для синтеза речи. Компания называет её самой естественной моделью в линейке: она работает с 44 языками, умеет передавать эмоции и начинает воспроизведение менее чем за 90 миллисекунд. Sonic 3.6 уже доступна в бета-версии через API Cartesia.
Что изменилось в Sonic 3.6
Разработчики говорят о фундаментальных улучшениях модели, сделанных на основе обратной связи от команд, которые используют Sonic в голосовых агентах и сервисах озвучки. Система автоматически подстраивает интонацию под смысл текста, сохраняет естественный темп и поддерживает невербальные реакции — например, смех. Русский язык входит в мультиязычный набор Sonic.
Главный результат релиза подтверждается независимым тестом Artificial Analysis. Sonic 3.6 заняла первое место и в основном Speech Arena, и в Controlled Voice Arena, где разные модели сравнивают на одинаковых клонированных голосах. Во втором рейтинге новая Cartesia опередила Sonic 3.5 и ElevenLabs Eleven v3, поэтому преимущество связано не только с удачным каталогом голосов, но и с качеством самого синтеза.
Кому пригодится новая модель
Sonic 3.6 ориентирована прежде всего на голосовых AI-агентов, поддержку клиентов и интерактивные приложения, где важна минимальная задержка. Но релиз интересен и креаторам: модель можно использовать для озвучки роликов, локализации контента, дубляжа UGC-креативов и быстрого тестирования разных голосовых подач.
API-модель стоит от $49 за миллион символов по данным Artificial Analysis. Открытых весов у Sonic 3.6 нет, а статус бета-версии означает, что перед внедрением в большой продакшен стоит проверить произношение имён, чисел и фирменной терминологии на собственных сценариях.
Почему это важно
Рынок AI-озвучки всё меньше сводится к выбору «самого красивого» голоса. Для бизнеса и авторов одновременно важны естественность, скорость, мультиязычность и предсказуемость API. Sonic 3.6 показывает, что у ElevenLabs появился сильный конкурент: теперь качественную локализацию и разговорные интерфейсы можно сравнивать не только по демо, но и по результатам независимых слепых тестов.