НовостьНейросетиAI-моделиЛокальные нейросети

Neutrino-1 8B уместила локальную AI-модель в 3,88 ГБ — она запускается даже на CPU

Fermion Research выпустила компактную Neutrino-1 8B: модель занимает 3,88 ГБ, работает локально на Mac и Linux и поднимает OpenAI-совместимый сервер.

Кирилл Киреев

27.07.2026 · 3 минут чтения · Нейросети

Neutrino-1 8B — компактная локальная AI-модель

Содержание

Neutrino-1 8B: локальная AI-модель на ноутбуке без облачных API

Fermion Research представила Neutrino-1 8B — компактную языковую модель, которую можно запустить локально без облачного API. Готовый контейнер весит 3,88 ГБ, а сама модель построена на базе Qwen3-8B и распространяется по лицензии Apache 2.0.

Что умеет Neutrino-1 8B

Разработчики сохранили 40 960 токенов контекста и оптимизировали веса так, чтобы модель помещалась на обычных пользовательских устройствах. В официальных тестах она набрала 72,1 балла в MMLU и 77,2 в строгом варианте IFEval — это не замена облачным флагманам, но достойный уровень для локальных черновиков, суммаризации и автоматизации.

На Apple M5 модель выдаёт до 24,9 токена в секунду только на CPU и до 33,7 токена в секунду через MLX. Версия для NVIDIA L4 работает со скоростью 30,7 токена в секунду и занимает 4,68 ГБ видеопамяти при контексте 4 000 токенов, поэтому её можно запускать и на видеокартах с 8 ГБ памяти.

Почему релиз полезен авторам и бизнесу

Главное преимущество локальной модели — данные остаются на устройстве. Neutrino-1 8B можно использовать для внутренних документов, заметок клиентов, расшифровок и других материалов, которые нежелательно отправлять во внешний AI-сервис. После загрузки модель также может работать без постоянного подключения к интернету.

Для быстрого старта достаточно установить пакет командой pip install fermion-research и запустить fermion chat. Есть режим локального сервера fermion serve с OpenAI-совместимым адресом, поэтому модель можно подключать к приложениям и привычным клиентам вместо облачного провайдера.

Что учитывать перед установкой

Neutrino-1 8B ориентирована на скорость, приватность и экономию памяти, а не на максимальное качество рассуждений. Для сложного анализа, ответственных юридических или медицинских задач результаты всё равно нужно проверять; зато модель выглядит практичным вариантом для локальных экспериментов, массовой обработки текста и автономных рабочих процессов.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости