Содержание
DSpark ускоряет локальные LFM2.5 без потери качества
Liquid AI выпустила открытые DSpark-чекпоинты для моделей LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Они добавляют спекулятивное декодирование: лёгкая модель заранее предлагает несколько следующих токенов, а основная проверяет их за один проход.
Что изменилось в скорости
По тестам Liquid AI, максимальное ускорение составило 3,18 раза на NVIDIA H100 и 2,87 раза при локальном запуске на MacBook Pro с M4 Max. Для LFM2.5-2.6B средняя скорость на ноутбуке выросла примерно с 61 до 139 токенов в секунду.
В сценариях с вызовом инструментов задержка сократилась в среднем на 57%. Это особенно важно для локальных AI-агентов: они быстрее планируют шаги, обращаются к функциям и продолжают работу без постоянного ожидания облачного сервера.
Почему качество ответов не меняется
DSpark не заменяет основную модель. Черновой модуль только предлагает продолжение, а LFM2.5 проверяет каждый токен и отклоняет неподходящие варианты. При детерминированной генерации итоговый текст остаётся таким же, как при обычном запуске модели.
Для пользователей это означает более быстрые приватные AI-инструменты на собственном устройстве. Для команд и бизнеса — возможность снизить задержку и увеличить пропускную способность серверов без перехода на более слабую модель.
Где доступна технология
DSpark-чекпоинты опубликованы в форматах Safetensors и GGUF на Hugging Face. Поддержка уже добавлена в llama.cpp и SGLang, поэтому разработчики могут использовать ускорение как на MacBook, так и на серверных GPU.