Содержание
Что умеет DeepSeek-V4-Flash-Vision-Exp
DeepSeek опубликовала DeepSeek-V4-Flash-Vision-Exp — первую экспериментальную мультимодальную модель семейства V4. Она построена на DeepSeek-V4-Flash-0731, но дополнена визуальным энкодером и модулем согласования изображений с текстом. Веса, конфигурация, код обработки изображений и минимальная реализация инференса доступны публично по лицензии MIT.
Изображения, инструменты и длинный контекст
Модель принимает перемежающиеся текстовые и графические блоки. Референсный код поддерживает OpenAI-совместимый формат сообщений, несколько изображений в одном запросе, многошаговые диалоги, вызовы инструментов и режимы рассуждений. В официальной конфигурации указан предел контекста 1 048 576 токенов, 256 маршрутизируемых экспертов и активация шести экспертов на токен.
Это крупная модель примерно на 305 млрд параметров. Репозиторий содержит 48 файлов весов, а их общий объём в хранилище Hugging Face составляет около 168 ГБ. Поэтому локальный запуск рассчитан на серверное оборудование: в инструкции DeepSeek приведён пример конвертации и запуска с тензорным параллелизмом на четырёх процессах.
Результаты тестов
По данным разработчиков, DeepSeek-V4-Flash-Vision-Exp набрала 83,9 балла в Terminal Bench 2.1, 59,3 в DeepSWE и 75,9 в Toolathlon-Verified. На мультимодальных агентных тестах результат составил 36,5 в ApexBench, 27,3 в Agents’ Last Exam, 64,3 в Chartography и 35,0 в ZeroBench.
В части тестов модель приблизилась к указанным DeepSeek результатам Opus 4.8, а в DeepSWE, Agents’ Last Exam и ZeroBench превысила их. Эти цифры опубликованы самой DeepSeek и получены в её агентном окружении; для ApexBench и Agents’ Last Exam текстовая DeepSeek-V4-Flash-0731 не видела графические элементы, поэтому сравнение с ней нужно трактовать осторожно.
Ограничения экспериментального релиза
DeepSeek называет релиз экспериментальным, а приложенный инференс — читаемой эталонной реализацией, а не готовым production-сервером. На момент публикации модель не подключена ни к одному Inference Provider на Hugging Face, а отдельный публичный API для Vision-версии не заявлен. Подтверждённый способ работы — скачать веса и запустить их самостоятельно.
Где попробовать
Веса и карточка модели находятся в официальном репозитории DeepSeek на Hugging Face. Команды конвертации весов, запуск примеров с изображениями и интерактивный режим описаны в инструкции по инференсу. Репозиторий открыт без gated-доступа и распространяется по лицензии MIT.
Как запустить модель локально
Скачайте официальный репозиторий
Получите все 48 частей весов и служебные файлы из репозитория DeepSeek на Hugging Face.Установите зависимости
Перейдите в каталог inference и установите пакеты из файла requirements.txt в отдельное Python-окружение.Конвертируйте веса
Укажите путь к исходным весам, каталог результата и число процессов тензорного параллелизма; официальный пример использует четыре процесса.Запустите тест с изображениями
Проверьте TXT- или JSON-пример, а затем передайте собственный запрос с текстовыми и графическими блоками.Оцените ресурсы до внедрения
Учитывайте объём весов около 168 ГБ и экспериментальный статус кода перед развёртыванием в рабочем сервисе.Коротко о релизе
Можно ли пользоваться моделью через готовый облачный API?
На момент публикации отдельный API и поддержка Hugging Face Inference Providers для этой модели не заявлены.
Разрешено ли коммерческое использование?
Репозиторий распространяется по лицензии MIT, которая допускает коммерческое использование при сохранении уведомления об авторских правах и текста лицензии.
Это финальная DeepSeek V4?
Нет. Разработчики прямо называют Vision-версию первым экспериментальным мультимодальным релизом семейства DeepSeek V4.