Содержание
Qwen3.8-Flash-Next: открытая модель, на которой можно проверить будущую архитектуру Qwen4
Команда Qwen открыла веса Qwen3.8-Flash-Next — мультимодальной MoE-модели и раннего превью архитектуры, на которой компания планирует строить семейство Qwen4. Это не обещание будущей модели: конкретные веса уже можно скачать, запустить на своей инфраструктуре или проверить через сервисы Qwen.
У модели 125 млрд основных параметров и ещё 51 млрд n-gram embeddings, но на каждом токене активируются 6 млрд параметров. Нативное окно контекста — 262 144 токена; Qwen заявляет возможность расширить его до 1 млн. Модель принимает текст и изображения, поэтому её можно дать на разбор репозитория вместе со скриншотом интерфейса, на сверку длинного технического документа с таблицей или на подготовку изменений в проекте после изучения нескольких файлов.
Что поставить в первый тест
Практичнее всего начинать не с абстрактного бенчмарка, а с законченной рабочей задачи: попросить модель найти место, где ломается сборка, объяснить зависимость в незнакомой кодовой базе, выделить риски в договоре или сверить диаграмму со спецификацией. Для агентных сценариев важен контекст: сначала дайте ей карту проекта и критерии готового результата, затем попросите составить план, а правки и вывод перепроверьте обычными тестами и человеком.
Слово Flash не делает модель лёгкой для домашнего компьютера. Шесть миллиардов активных параметров на токен — это не размер полного набора весов: он включает 125 млрд основных параметров и 51 млрд n-gram embeddings. Qwen перечисляет поддержку Transformers, SGLang, vLLM, llama.cpp, MLX и Unsloth; для высоконагруженного сервинга сама команда рекомендует специализированные движки. Миллион токенов тоже не является настройкой по умолчанию: нативный предел — 262 144, а расширение требует отдельной конфигурации.
Есть и важный нюанс для бизнеса. Веса опубликованы по Qwen Community License 1.0, а не по Apache-2.0. Лицензия отдельно оговаривает коммерческий Model as a Service и самостоятельных AI-помощников для кода или офисной работы: для таких случаев может понадобиться отдельная лицензия Qwen. Внутреннее использование в документе вынесено в исключение, если возможности модели не предоставляются третьим лицам.
Где попробовать
- Qwen3.8-Flash-Next на Hugging Face — официальные веса и конфигурация. Для самостоятельного запуска нужна совместимая инфраструктура; действует Qwen Community License 1.0.
- QwenWork — официальный репозиторий Qwen сообщает, что новая модель работает в режиме Standard. Тарифы и региональная доступность в анонсе не уточняются.
- QwenCloud — официальный облачный доступ и API. Репозиторий подтверждает поддержку Qwen3.8-Flash-Next; в облачной витрине production-версия называется Qwen3.8-Flash и построена на этой архитектуре.
- GitHub-репозиторий Qwen — официальные инструкции для Transformers, SGLang, vLLM и других совместимых движков.
Если вы передаёте модели закрытый код или документы, не путайте доступность весов с правилами облачного сервиса: для API отдельно проверьте политику данных, журналы и условия вашего аккаунта. Для первого эксперимента достаточно небольшой, но проверяемой выборки — так быстрее понять, оправдывает ли модель затраты на развёртывание.
Как начать работать с Qwen3.8-Flash-Next
Выберите способ доступа
Для знакомства откройте QwenWork, для API используйте QwenCloud, а для самостоятельного запуска перейдите на модельную карточку Hugging Face.Прочитайте лицензию
Перед запуском коммерческого API или отдельного помощника для кода и офиса проверьте условия Qwen Community License 1.0.Подготовьте совместимый движок
Qwen перечисляет Transformers, SGLang, vLLM, llama.cpp, MLX и Unsloth. Для сервера выберите подходящий вашему стеку вариант.Дайте проверяемую рабочую задачу
Начните с фрагмента репозитория, набора документов или скриншота и заранее сформулируйте ожидаемый результат и способ проверки.Контролируйте контекст и результат
Нативный контекст составляет 262 144 токена, а расширение до 1 млн требует отдельной настройки. Проверяйте вывод тестами и человеком.Доступ и ограничения Qwen3.8-Flash-Next
Где взять веса модели?
На официальной странице Qwen на Hugging Face. Для загрузки и запуска нужна совместимая инфраструктура.
Можно ли работать через API?
Да. Официальный репозиторий указывает поддержку QwenCloud. Его production-версия называется Qwen3.8-Flash и основана на архитектуре Next.
Подойдёт ли модель для обычного компьютера?
Полные веса включают 125 млрд основных и 51 млрд n-gram параметров. Шесть миллиардов активируются на токен, но это не делает модель лёгкой для локального запуска.
Какая у модели лицензия?
Qwen Community License 1.0. Она не равна Apache-2.0; для коммерческого Model as a Service и самостоятельных помощников для кода или офиса могут потребоваться отдельные условия Qwen.