Содержание
LFM2.5-VL-3B: локальный AI для экранов, документов и изображений
Liquid AI представила LFM2.5-VL-3B — компактную vision-language модель на 3,1 млрд параметров. Она анализирует изображения, документы и интерфейсы, умеет находить объекты по текстовому запросу, сопоставлять несколько картинок и вызывать внешние инструменты.
Что изменилось в новой версии
Главный акцент сделан на понимании цифровых экранов. Модель распознаёт элементы мобильных, веб- и десктопных интерфейсов, поэтому её можно использовать как зрительный модуль для локальных AI-агентов: например, чтобы находить нужную кнопку, читать форму или работать с приложением по изображению экрана.
Также Liquid AI заметно улучшила привязку объектов к координатам, обработку нескольких изображений и function calling. В тесте RefCOCO результат вырос с 57,1 до 87,9 балла, а ToolSandbox — с 26,4 до 59,5. По среднему результату на 28 визуальных тестах модель приблизилась к более крупной Qwen 3.5 4B и обошла ряд моделей Gemma.
Почему локальный запуск важен
LFM2.5-VL-3B занимает около 3 ГБ памяти и поддерживает llama.cpp, MLX, vLLM, SGLang и ONNX. По данным разработчиков, скорость достигает 228 токенов в секунду на Apple M5 Max, 116 токенов в секунду на AMD Ryzen AI Max+ 395 и около 20 токенов в секунду на Galaxy S26 Ultra.
Для авторов и бизнеса это означает, что распознавание документов, скриншотов и изображений можно выполнять прямо на устройстве — без отправки чувствительных данных в облако. Модель отвечает напрямую, без длинной цепочки рассуждений, поэтому подходит для приложений, где важна минимальная задержка.
Где попробовать
Вес модели уже опубликован на Hugging Face. Там же доступна WebGPU-демоверсия, которая запускается в браузере и позволяет загрузить изображение или сделать снимок с камеры. LFM2.5-VL-3B можно скачивать, дообучать и разворачивать на собственной инфраструктуре.