Нейролюб
НовостьНейросетиDeepSeekНейросети

DeepSeek V4 Flash научилась видеть — новая модель читает фото, скриншоты и графики

DeepSeek выпустила экспериментальную V4 Flash Vision: модель анализирует фотографии, скриншоты, документы и графики через OpenAI- и Anthropic-совместимые API.

Кирилл Киреев

21.08.2026 · 4 минут чтения · Нейросети

Мультимодальная AI-модель анализирует фотографии, документы и графики

Содержание

DeepSeek V4 Flash получила зрение

DeepSeek открыла доступ к экспериментальной мультимодальной модели DeepSeek-V4-Flash-Vision-Exp. Она принимает изображения вместе с текстом и умеет описывать фотографии, читать текст со скриншотов, разбирать документы и анализировать графики. Модель уже доступна через API по идентификатору deepseek-v4-flash-vision-exp.

Что умеет новая модель

Изображения можно отправлять тремя способами: как Base64 внутри запроса, по публичной ссылке или через Files API. Поддерживаются JPEG, PNG, GIF и WebP. Для быстрой обработки есть режим detail=low, а в обычном режиме картинка сохраняет исходную детализацию перед внутренним масштабированием.

Модель работает с OpenAI-совместимыми Chat Completions и Responses API, а также с Anthropic-совместимым форматом сообщений. Это упрощает замену провайдера в существующих приложениях: разработчикам не нужно полностью переписывать интеграцию, чтобы добавить распознавание изображений.

Почему это полезно создателям контента и бизнесу

Практические сценарии — разбор рекламных креативов, извлечение данных из скриншотов, проверка диаграмм, классификация товарных фотографий и автоматизация работы с визуальными документами. За один запрос можно передать до 600 изображений, поэтому модель подходит и для пакетной обработки каталогов или больших наборов материалов.

DeepSeek утверждает, что по текстовым задачам Vision-версия сохраняет уровень обычной V4 Flash, а в агентных тестах с визуальным пониманием заметно приближается к Opus 4.8. При этом это экспериментальный релиз: для важных цифр, таблиц и решений результаты всё равно стоит проверять человеком.

Цена и ограничения

Тарифы совпадают с DeepSeek V4 Flash: в непиковые часы миллион входных токенов без кеша стоит $0,22, а миллион выходных — $0,66; в пиковые часы цены вдвое выше. Изображения переводятся во входные токены, максимум — 384 токена на одну картинку после масштабирования. Контекст модели достигает 1 миллиона токенов, максимальный вывод — 384 тысячи токенов.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости