Содержание
Inflect Micro v2: компактный AI-голос для локальной озвучки
Независимый разработчик Оуэн Сонг выпустил Inflect Micro v2 — открытую модель синтеза речи, которая превращает текст в готовую аудиоволну полностью локально. В ней всего 9,36 млн параметров, а полный набор весов FP32 занимает 37,53 МБ. Модель распространяется по лицензии Apache 2.0.
Озвучка без облака и мощной видеокарты
Inflect Micro v2 генерирует английскую речь с частотой 24 кГц и запускается как на CPU, так и на CUDA. В опубликованном разработчиком тесте на четырёх потоках CPU система создавала аудио в 6,28 раза быстрее реального времени. Это делает её подходящей для локальных приложений, прототипов, офлайн-инструментов и устройств, где большая голосовая модель слишком тяжела.
Обновление 2.1 добавило проверенные ONNX-графы и отдельный интерфейс без зависимости от PyTorch. Доступны провайдеры CPU, CUDA и DirectML, а также материалы для запуска в браузере. Генерацию можно повторять с фиксированным seed, менять скорость и степень вариативности голоса.
Что умеет модель
Система поддерживает длинные тексты: она делит их по знакам препинания, озвучивает фрагменты и аккуратно соединяет результат паузами. Разработчик также опубликовал тесты разборчивости, натуральности и скорости, примеры аудио и контрольные суммы файлов, чтобы результаты можно было проверить.
Главное ограничение
Сейчас Inflect Micro v2 предлагает только один фиксированный синтетический английский голос. Русского языка, клонирования голоса и выбора диктора нет, а адаптация под новые языки и голоса официально не поддерживается. Поэтому это прежде всего компактная база для разработчиков и локальных англоязычных проектов, а не готовая замена облачным студиям озвучки.
Для авторов и бизнеса релиз интересен приватностью и предсказуемой стоимостью: текст и аудио можно обрабатывать на собственном устройстве без оплаты за каждую генерацию. Но качество и удобство в реальном проекте стоит проверять на своих сценариях, особенно на длинных фразах, именах и сложной пунктуации.