Содержание
Neutrino-1 8B: локальная AI-модель на ноутбуке без облачных API
Fermion Research представила Neutrino-1 8B — компактную языковую модель, которую можно запустить локально без облачного API. Готовый контейнер весит 3,88 ГБ, а сама модель построена на базе Qwen3-8B и распространяется по лицензии Apache 2.0.
Что умеет Neutrino-1 8B
Разработчики сохранили 40 960 токенов контекста и оптимизировали веса так, чтобы модель помещалась на обычных пользовательских устройствах. В официальных тестах она набрала 72,1 балла в MMLU и 77,2 в строгом варианте IFEval — это не замена облачным флагманам, но достойный уровень для локальных черновиков, суммаризации и автоматизации.
На Apple M5 модель выдаёт до 24,9 токена в секунду только на CPU и до 33,7 токена в секунду через MLX. Версия для NVIDIA L4 работает со скоростью 30,7 токена в секунду и занимает 4,68 ГБ видеопамяти при контексте 4 000 токенов, поэтому её можно запускать и на видеокартах с 8 ГБ памяти.
Почему релиз полезен авторам и бизнесу
Главное преимущество локальной модели — данные остаются на устройстве. Neutrino-1 8B можно использовать для внутренних документов, заметок клиентов, расшифровок и других материалов, которые нежелательно отправлять во внешний AI-сервис. После загрузки модель также может работать без постоянного подключения к интернету.
Для быстрого старта достаточно установить пакет командой pip install fermion-research и запустить fermion chat. Есть режим локального сервера fermion serve с OpenAI-совместимым адресом, поэтому модель можно подключать к приложениям и привычным клиентам вместо облачного провайдера.
Что учитывать перед установкой
Neutrino-1 8B ориентирована на скорость, приватность и экономию памяти, а не на максимальное качество рассуждений. Для сложного анализа, ответственных юридических или медицинских задач результаты всё равно нужно проверять; зато модель выглядит практичным вариантом для локальных экспериментов, массовой обработки текста и автономных рабочих процессов.