Содержание
Needle 2 переносит AI-агентов на самые компактные устройства
Cactus Compute представила Needle 2 — открытую специализированную модель для вызова инструментов, управления устройствами и извлечения структурированных данных. При 45 млн параметров вся модель занимает один файл размером 14 МБ, а полная сессия требует около 28 МБ оперативной памяти.
AI без облака и мощного ускорителя
Needle 2 рассчитана на смартфоны, часы, умный дом, небольших роботов, автомобильные системы и микроконтроллеры. По данным разработчиков, модель выдаёт около 500 токенов в секунду на Raspberry Pi 5 и 300–700 токенов в секунду на недорогих смартфонах. Для работы ей не нужны GPU или NPU.
Это не универсальный чат-бот. Модель решает более узкую задачу: превращает естественную команду в точный вызов функции с нужными аргументами. Например, она может выбрать действие для умного дома, выполнить команду на носимом устройстве или извлечь поля из текста по заданной схеме.
Почему модель получилась такой маленькой
Needle 2 обучалась сразу с двухбитным сжатием, поэтому её не пришлось уменьшать после обучения с риском потерять качество. Контекст ограничен скользящим окном на 256 токенов, а описание доступных инструментов закрепляется в памяти. Благодаря этому расход оперативной памяти не растёт вместе с длиной сессии.
На публичных тестах вызова функций модель, по данным Cactus Compute, обменивается победами с FunctionGemma 270M, LFM2.5 230M и локальной моделью Apple, оставаясь в 5–70 раз компактнее. Сравнение нужно воспринимать с оговоркой: Needle 2 узко обучена именно управлению устройствами, тогда как соперники решают более широкий круг задач.
Что это меняет для продуктов
Компактный локальный агент снижает задержку, не требует постоянного соединения и позволяет не отправлять голосовые команды или пользовательские данные в облако. Модель выпущена под лицензией Apache 2.0, веса доступны на Hugging Face, а код — на GitHub. Разработчики также могут дообучить её под собственный набор функций на обычном компьютере.