Нейролюб
НовостьНейросетиОткрытые моделиБольшие языковые модели

Qwen открыла веса Qwen3.8-Flash-Next — раннее превью архитектуры Qwen4

Qwen открыла веса мультимодальной MoE-модели Qwen3.8-Flash-Next: 262 тыс. токенов нативного контекста, 6 млрд активных параметров на токен и раннее превью архитектуры Qwen4.

Кирилл Киреев

30.08.2026 · 5 минут чтения · Нейросети

Qwen3.8-Flash-Next official architecture diagram

Содержание

Qwen3.8-Flash-Next: открытая модель, на которой можно проверить будущую архитектуру Qwen4

Команда Qwen открыла веса Qwen3.8-Flash-Next — мультимодальной MoE-модели и раннего превью архитектуры, на которой компания планирует строить семейство Qwen4. Это не обещание будущей модели: конкретные веса уже можно скачать, запустить на своей инфраструктуре или проверить через сервисы Qwen.

У модели 125 млрд основных параметров и ещё 51 млрд n-gram embeddings, но на каждом токене активируются 6 млрд параметров. Нативное окно контекста — 262 144 токена; Qwen заявляет возможность расширить его до 1 млн. Модель принимает текст и изображения, поэтому её можно дать на разбор репозитория вместе со скриншотом интерфейса, на сверку длинного технического документа с таблицей или на подготовку изменений в проекте после изучения нескольких файлов.

Что поставить в первый тест

Практичнее всего начинать не с абстрактного бенчмарка, а с законченной рабочей задачи: попросить модель найти место, где ломается сборка, объяснить зависимость в незнакомой кодовой базе, выделить риски в договоре или сверить диаграмму со спецификацией. Для агентных сценариев важен контекст: сначала дайте ей карту проекта и критерии готового результата, затем попросите составить план, а правки и вывод перепроверьте обычными тестами и человеком.

Слово Flash не делает модель лёгкой для домашнего компьютера. Шесть миллиардов активных параметров на токен — это не размер полного набора весов: он включает 125 млрд основных параметров и 51 млрд n-gram embeddings. Qwen перечисляет поддержку Transformers, SGLang, vLLM, llama.cpp, MLX и Unsloth; для высоконагруженного сервинга сама команда рекомендует специализированные движки. Миллион токенов тоже не является настройкой по умолчанию: нативный предел — 262 144, а расширение требует отдельной конфигурации.

Есть и важный нюанс для бизнеса. Веса опубликованы по Qwen Community License 1.0, а не по Apache-2.0. Лицензия отдельно оговаривает коммерческий Model as a Service и самостоятельных AI-помощников для кода или офисной работы: для таких случаев может понадобиться отдельная лицензия Qwen. Внутреннее использование в документе вынесено в исключение, если возможности модели не предоставляются третьим лицам.

Где попробовать

  • Qwen3.8-Flash-Next на Hugging Face — официальные веса и конфигурация. Для самостоятельного запуска нужна совместимая инфраструктура; действует Qwen Community License 1.0.
  • QwenWork — официальный репозиторий Qwen сообщает, что новая модель работает в режиме Standard. Тарифы и региональная доступность в анонсе не уточняются.
  • QwenCloud — официальный облачный доступ и API. Репозиторий подтверждает поддержку Qwen3.8-Flash-Next; в облачной витрине production-версия называется Qwen3.8-Flash и построена на этой архитектуре.
  • GitHub-репозиторий Qwen — официальные инструкции для Transformers, SGLang, vLLM и других совместимых движков.

Если вы передаёте модели закрытый код или документы, не путайте доступность весов с правилами облачного сервиса: для API отдельно проверьте политику данных, журналы и условия вашего аккаунта. Для первого эксперимента достаточно небольшой, но проверяемой выборки — так быстрее понять, оправдывает ли модель затраты на развёртывание.

Как начать работать с Qwen3.8-Flash-Next

01

Выберите способ доступа

Для знакомства откройте QwenWork, для API используйте QwenCloud, а для самостоятельного запуска перейдите на модельную карточку Hugging Face.

Прочитайте лицензию

Перед запуском коммерческого API или отдельного помощника для кода и офиса проверьте условия Qwen Community License 1.0.
02

Подготовьте совместимый движок

Qwen перечисляет Transformers, SGLang, vLLM, llama.cpp, MLX и Unsloth. Для сервера выберите подходящий вашему стеку вариант.
03

Дайте проверяемую рабочую задачу

Начните с фрагмента репозитория, набора документов или скриншота и заранее сформулируйте ожидаемый результат и способ проверки.
04

Контролируйте контекст и результат

Нативный контекст составляет 262 144 токена, а расширение до 1 млн требует отдельной настройки. Проверяйте вывод тестами и человеком.

Доступ и ограничения Qwen3.8-Flash-Next

Где взять веса модели?

На официальной странице Qwen на Hugging Face. Для загрузки и запуска нужна совместимая инфраструктура.

Можно ли работать через API?

Да. Официальный репозиторий указывает поддержку QwenCloud. Его production-версия называется Qwen3.8-Flash и основана на архитектуре Next.

Подойдёт ли модель для обычного компьютера?

Полные веса включают 125 млрд основных и 51 млрд n-gram параметров. Шесть миллиардов активируются на токен, но это не делает модель лёгкой для локального запуска.

Какая у модели лицензия?

Qwen Community License 1.0. Она не равна Apache-2.0; для коммерческого Model as a Service и самостоятельных помощников для кода или офиса могут потребоваться отдельные условия Qwen.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости