DeepSeek V4 Flash Vision вышла: что умеет модель
DeepSeek открыла API-доступ к экспериментальной мультимодальной модели V4 Flash Vision. Она принимает изображения вместе с текстом, работает с инструментами и получила отдельные тарифы. Для рабочих процессов это интересный кандидат, но выпуск пока нельзя принимать за готовую замену проверенному контуру.
Подходит, когда нужно проверить идею с текстом или изображением без отдельной настройки каждого сервиса.
Открыть Musya GPT
Что именно выпустила DeepSeek
21 августа DeepSeek добавила в официальный changelog модель deepseek-v4-flash-vision-exp. Это не тихое переименование старого V4 Flash, а отдельная экспериментальная версия с пониманием изображений. Вендор утверждает, что её возможности на чисто текстовых задачах находятся на уровне DeepSeek-V4-Flash, а результаты мультимодальных агентных тестов близки к Opus 4.8.
Слово «экспериментальная» здесь важнее рекламной мишуры. Оно означает, что контракт API и доступность уже можно тестировать, но переносить на модель критичный процесс без контрольной выборки рано. Официальная страница не обещает безошибочное чтение мелкого текста, сложных схем или любых форматов изображений.
Разобраться, как соединять визуальные задачи и ИИ-инструменты, помогают программы по нейросетям на KGAM.Blog.

Как вызвать модель и сколько стоит запрос
В API нужно указать model='deepseek-v4-flash-vision-exp'. Официальная таблица заявляет контекст 1 млн токенов, максимальный вывод 384 тыс. токенов, JSON Output, Tool Calls, Responses API и совместимость с Anthropic API. FIM-дополнение для этой версии не поддерживается.
Тариф динамический. За 1 млн токенов вне пика DeepSeek берёт $0.007 при попадании входа в кэш, $0.22 без попадания и $0.66 за вывод. В пиковые часы ставки удваиваются: $0.014, $0.44 и $1.32. Пик указан как 01:00-04:00 и 06:00-10:00 UTC, то есть 06:00-09:00 и 11:00-15:00 по Екатеринбургу. Изображения переводятся в токены в зависимости от размеров и оплачиваются вместе с текстовым вводом. Цены могут измениться.

Для карточек товара, платёжных документов и отчётов нужен режим с ручной проверкой: визуальный ответ не должен автоматически запускать действие.
Сопоставляйте баллы только при одинаковой обвязке: harness, effort, temperature и top_p заметно меняют итоговый результат.
Тестовый набор должен включать чистые, шумные и искажённые изображения с заранее известным правильным результатом для каждого файла.
Кому полезен анализ изображений
Практический интерес есть у маркетплейсов, аналитиков, разработчиков и редакций. Модель можно испытывать на поиске расхождений между фото товара и описанием, чтении подписей на графике, извлечении полей из документа или разборе скриншота ошибки. Это примеры тестов, а не гарантия заявленной точности.
Для обычного пользователя релиз означает больше конкуренции среди визуальных моделей и потенциально более дешёвые эксперименты. Для команды - ещё один API, который придётся обвязать логированием, повторной проверкой и ограничением расходов. Если ошибка способна испортить карточку товара, платёж или отчёт, человек должен видеть исходное изображение рядом с ответом.

Где цифры требуют осторожности
DeepSeek приводит сильные результаты: 83.9 на Terminal Bench 2.1, 63.6 на DSBench-Hard, 64.3 на Chartography и 35.0 Pass@5 на ZeroBench. Но это вендорские измерения в конкретной обвязке. В changelog указаны DeepSeek Harness в минимальном режиме, максимальное усилие, top_p=0.95 и температура 1.0.
Есть ещё одна тонкость. В некоторых текстовых агентных тестах базовый V4 Flash игнорировал мультимодальные элементы, поэтому прямое сравнение не всегда доказывает пользу зрения. Бенчмарк помогает выбрать кандидата, но не отвечает, прочитает ли модель ваш смазанный ценник, необычную диаграмму или таблицу с мелким шрифтом.

Что проверить перед рабочим запуском
Соберите 30-50 реальных изображений трёх уровней сложности и заранее запишите правильные ответы. Отдельно измерьте точность фактов, долю выдумок, задержку и стоимость одного успешного результата. Затем повторите тест в пиковое и непиковое время, с кэшем и без него.
Не отправляйте персональные данные и закрытые документы, пока юридические и технические условия обработки не проверены вашей организацией. Зафиксируйте версию модели, параметры и дату теста: экспериментальный API может измениться, а вчерашний удачный прогон не даёт пожизненной гарантии.
Вывод KGAM: DeepSeek V4 Flash Vision выглядит серьёзным и дешёвым кандидатом для визуальных пайплайнов. Но сегодня разумный шаг - короткий контролируемый пилот. Сначала докажите качество на своих картинках и посчитайте полный запрос, а уже потом тащите модель в прод.
Факты и цены проверены 21.08.2026 по официальным материалам DeepSeek. Внешние первоисточники сохранены во внутреннем факт-чеке и не размещены в публичном тексте.