Содержание
Ling 3.0 Flash: компактная открытая модель для кода и AI-агентов
Команда inclusionAI из Ant Group представила Ling 3.0 Flash — открытую модель нового поколения, которая при общем размере 124 млрд параметров активирует только 5,1 млрд на каждый токен. Благодаря разреженной MoE-архитектуре модель обещает производительность более крупных систем при меньшей вычислительной нагрузке.
Что изменилось в Ling 3.0 Flash
Модель получила гибридную архитектуру внимания и контекст до 256 тысяч токенов. По данным разработчиков, она сравнялась с предыдущей флагманской системой класса 1 трлн параметров или превзошла её в ключевых тестах, хотя использует заметно меньше активных параметров.
Отдельный акцент сделан на практической работе AI-агентов. Ling 3.0 Flash обучали более чем в 10 тысячах интерактивных сред для программирования, исследований и выполнения многошаговых задач. Разработчики заявляют поддержку Claude Code, Kilo Code, Qwen Code, Hermes Agent и OpenClaw, а также улучшения в SWE-Bench, MCP-Atlas и других агентных тестах.
Почему модель интересна разработчикам и бизнесу
Сочетание длинного контекста и небольшого числа активных параметров может снизить стоимость сложных агентных сценариев: анализа больших репозиториев, работы с документами и автоматизации процессов. Встроенное многоуровневое кэширование, по оценке авторов, сокращает время до первого токена на 60–80% при длинном входном контексте.
Как попробовать Ling 3.0 Flash
Веса опубликованы на Hugging Face, а доступ к модели также появился через OpenRouter и DeepInfra. Для самостоятельного запуска предусмотрены инструкции для SGLang и vLLM; полноценное развёртывание требует нескольких мощных GPU, поэтому большинству пользователей проще начать с облачного API.