Содержание
Fish Audio получила рекордный для посевного раунда капитал и ускорит развитие генерации речи
Разработчик голосовых AI-моделей Fish Audio привлёк $50 млн в посевном раунде. Компания собирается направить деньги на более продвинутые модели для креаторов и бизнеса — в том числе на систему понимания аудио и модель, которая преобразует речь напрямую в речь.
Fish Audio выросла из открытого проекта бывшего исследователя NVIDIA Шицзя Ляо. Сейчас сервисом и его open-source моделями пользуются более 8 млн человек, а репозиторий Fish Speech собрал свыше 31 тыс. звёзд на GitHub. Платформа предлагает более 15 тыс. управляющих параметров естественного языка, с помощью которых можно настраивать интонацию и характер голоса.
Что уже доступно креаторам
За последний год компания выпустила пять моделей: четыре для синтеза речи и одну для распознавания. Три голосовые модели открыты, а флагманская S2.1 Pro работает через платный API. В подписках для авторов и команд доступны минуты генерации и клонирование голоса; технологию Fish Audio уже используют HeyGen, игровые студии и разработчики голосовых агентов.
Что появится дальше
До конца года Fish Audio планирует выпустить модель для понимания аудио, а также speech-to-speech систему. Такой подход нужен для более живого дубляжа, локализации роликов, голосов игровых персонажей и AI-операторов с низкой задержкой — без промежуточного превращения разговора в текст.
На что обратить внимание авторам
Вместе с ростом сервиса остаётся вопрос прав на голос. Ранее авторы жаловались, что их голоса загружали на платформу без согласия. Fish Audio заявляет, что автоматизировала удаление спорных копий: владелец может отправить образец голоса или договор, после чего модель обещают снять с площадки менее чем за три минуты. Но предварительной проверки каждой загрузки пока нет, поэтому перед коммерческим использованием стоит отдельно проверять права и лицензию на выбранный голос.
Для рынка это важный сигнал: конкуренция с ElevenLabs и другими сервисами смещается от просто реалистичного звучания к точному управлению эмоциями, скорости ответа и прозрачному лицензированию голосов. Креаторам это даст больше вариантов для озвучки и локализации, а бизнесу — инструменты для масштабирования поддержки и продаж.