DeepSeek научился видеть картинки: V4 Flash Vision для скриншотов и чеков в 2026
21 августа 2026 DeepSeek выпустил V4-Flash-Vision-Exp - первую модель компании, которая принимает картинки на вход. По визуальным бенчмаркам счёт с Claude Opus 4.8 равный, а выходной токен стоит в 38 раз дешевле. Разбираем цены в рублях, доступ из России и главное ограничение, о котором молчат обзоры.
17 мин чтения
21 августа 2026 DeepSeek выпустил V4-Flash-Vision-Exp - первую свою модель, которая принимает картинки на вход. Раньше у DeepSeek был только текст: ни чек сфотографировать, ни скриншот кинуть. Теперь можно, но пока лишь через платный API для разработчиков, в бесплатном чате этой возможности нет.
Главная цифра новости лежит в деньгах. На визуальных бенчмарках модель разошлась с Claude Opus 4.8 со счётом 2:2, при этом выходной токен у неё стоит 0,66 доллара за миллион против 25 долларов у Opus. Разница почти в 38 раз. Ниже разберём, что это значит на практике, сколько выходит в рублях, как получить доступ из России и какое ограничение убивает половину сценариев, если о нём не знать.
DeepSeek V4-Flash-Vision-Exp вышел 21 августа 2026 и читает картинки: скриншоты, чеки, документы, графики. Одна картинка стоит максимум 384 токена, то есть около 0,7 копейки. На четырёх визуальных тестах счёт с Claude Opus 4.8 равный, 2:2, но цифры замерял сам DeepSeek. Модель доступна только по API, в бесплатном чате её нет. Главная засада: перед распознаванием картинка сжимается до площади примерно 800 на 800 пикселей, поэтому полноэкранные скриншоты нужно резать на фрагменты.
Словарик: пять терминов из этой статьи
- Мультимодальность - способность модели принимать не только текст. У Vision Exp на входе текст и картинки, на выходе по-прежнему только текст.
- V4 Flash - быстрая и дешёвая текстовая модель DeepSeek, вышедшая в апреле 2026. Vision Exp построен на ней.
- Exp в названии - официальная пометка «эксперимент». Веса не выложены, техотчёта нет, модель могут поменять или убрать без предупреждения.
- Токен картинки - во сколько входных токенов обходится один снимок. У Vision Exp потолок 384 токена на картинку любого размера.
- Пиковые часы - время загрузки серверов DeepSeek, когда токены стоят вдвое дороже. Привязаны к рабочему дню в Китае.
Что именно выпустил DeepSeek 21 августа
Формально это ответвление от модели V4 Flash: тот же скелет, к которому прикрутили зрение. Про архитектуру самого зрения компания не сказала ничего, но параметры базовой модели известны: разреженная схема Mixture of Experts, 284 миллиарда параметров всего и 13 миллиардов активных на каждый запрос. Обучение шло на 32 триллионах токенов.
Технические лимиты у Vision Exp щедрые:
максимум на одну картинку любого размера и веса
можно положить в один запрос
окно контекста, ответ до 384 тысяч токенов
примерная цена разбора тысячи чеков по непиковому тарифу
Форматы принимает обычные: JPEG, PNG, GIF, WebP. Формат определяется по содержимому файла, а не по расширению, так что переименованный в .png скриншот всё равно уедет корректно. Картинку можно передать тремя способами: base64 прямо в запросе, ссылкой на публичный URL или через Files API для тяжёлых файлов.
Чем Vision Exp отличается от обычного V4 Flash
Неожиданный побочный эффект: модель со зрением стала лучше и на текстовых задачах. Из девяти общих метрик Vision Exp обошёл текстовый V4-Flash-0731 на восьми. Самый заметный рост на ApexBench, плюс 10,3 балла, но там есть оговорка: текстовая версия просто не видела картиночные части заданий и физически не могла их решить.
Единственная просадка на Cybergym, тесте на поиск уязвимостей в коде: 75,3 против 76,7. Разница в пределах шума, но она есть.
Из практического: у Vision Exp отключили режим FIM, то есть дописывание кода в середине файла. Если у тебя на нём построен автокомплит, оставайся на текстовом V4 Flash.
Почему это важнее, чем кажется по анонсу
В разборе DeepSeek V4 Pro две недели назад мы честно написали: картинки, голос и камеру DeepSeek не заменяет никак, ввод только текстовый, и это половина того, зачем обычные люди открывают ChatGPT. Пункт про картинки закрыт за две недели.
Разрыв между дешёвой китайской моделью и флагманами сжимается быстрее, чем успевают обновляться обзоры. Год назад распознавание документов было привилегией моделей за десятки долларов за миллион токенов. Сейчас оно стоит копейки и работает по OpenAI-совместимому протоколу, то есть переезд занимает одну строчку в конфиге.
Vision Exp понимает три диалекта API сразу: Chat Completions от OpenAI, новый Responses API и Messages API в стиле Anthropic. Практически это значит, что код, написанный под ChatGPT или под Claude, заводится сменой базового URL и ключа.
Насколько модель правда тягается с Opus 4.8
Заголовки в зарубежной прессе звучали как «DeepSeek обошёл Opus 4.8». Реальность спокойнее: на четырёх визуальных бенчмарках счёт равный.
| Бенчмарк | Что проверяет | Vision Exp | Opus 4.8 | Кто выиграл |
|---|---|---|---|---|
| ZeroBench (Pass@5) | 100 сложных задач на анализ изображений | 35,0 | 34,0 | Vision Exp |
| Agents Last Exam | больше 1000 многошаговых задач с приложениями | 27,3 | 25,7 | Vision Exp |
| ApexBench (Pass@1) | комплексные агентские сценарии | 36,5 | 39,4 | Opus 4.8 |
| Chartography | чтение и разбор графиков | 64,3 | 65,0 | Opus 4.8 |
Обрати внимание на масштаб проигрышей: 0,7 балла на графиках и 2,9 на ApexBench. Для модели, которая дешевле в двадцать с лишним раз по входу, это очень близко.
Формула: за 3-5 процентов качества на визуальных задачах ты платишь в 20-38 раз меньше. Если объём измеряется тысячами картинок в месяц, экономия перевешивает разницу в баллах.
Что не так с этими цифрами
Три оговорки, без которых таблица выше вводит в заблуждение.
Замеры сделал сам DeepSeek. Прогон шёл через собственный движок компании в режиме Harness Minimal Mode. Независимой перепроверки на момент публикации нет. Обвинения в подтасовке тут нет: вендорские бенчмарки устроены так у всех производителей моделей.
Нет сырых данных. Компания не выложила логи прогонов, размеры выборок и доверительные интервалы. Разница в один балл на ZeroBench без интервалов может оказаться случайностью.
Модель экспериментальная. Веса не опубликованы, техотчёта нет, архитектура зрительной части не раскрыта. Ставить такую модель в продакшен-конвейер без плана отката рискованно.
Пометка Exp в названии означает, что модель могут переименовать, переучить или снять с платформы без переходного периода. Если строишь на ней рабочий процесс, держи в коде запасной путь на другую модель и не завязывай на неё критичные операции вроде бухгалтерии за квартал.
Разобраться с API картинок проще, когда рядом есть ИИ-помощник, который пишет код за тебя. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Сколько стоит посмотреть на картинку: цены в рублях
Vision Exp тарифицируется по тем же ставкам, что и текстовый V4 Flash, картинка просто считается входными токенами. Курс ЦБ на 22 августа 2026 составляет 82,92 ₽ за доллар.
| Что считаем | Непиковый, $ | Пиковый, $ | Непиковый, ₽ | Пиковый, ₽ |
|---|---|---|---|---|
| Вход, 1 млн токенов | 0,22 | 0,44 | 18,2 | 36,5 |
| Выход, 1 млн токенов | 0,66 | 1,32 | 54,7 | 109,5 |
| Попадание в кэш, 1 млн | 0,007 | 0,014 | 0,58 | 1,16 |
| Одна картинка (384 токена) | 0,000084 | 0,000169 | 0,007 | 0,014 |
Теперь то же самое рядом с флагманом. У Claude Opus 4.8 базовый прайс 5 долларов за миллион входных токенов и 25 за миллион выходных.
Соберём реальный счёт на бытовой задаче. Тысяча чеков, к каждому короткий промпт на 120 токенов и ответ в JSON примерно на 250 токенов.
- картинки: 1000 на 384 токена = 384 тысячи входных токенов, это 7,0 ₽
- текст промптов: 120 тысяч входных токенов, это 2,2 ₽
- ответы: 250 тысяч выходных токенов, это 13,7 ₽
Итого около 23 ₽ за разбор тысячи чеков, если гонять в непиковые часы. В пиковые выйдет вдвое дороже, примерно 46 ₽. Для сравнения: один час работы бухгалтера на ручном вводе стоит больше, а тысячу чеков руками он не введёт и за день.
Пиковые часы у DeepSeek привязаны к рабочему дню в Китае, это примерно с 04:00 до 13:00 по Москве. Пакетную обработку архива чеков или скриншотов ставь на вечер или ночь и плати ровно вдвое меньше за те же токены.
Главное ограничение: картинку ужимают до 800 на 800
Вот пункт, который теряется в обзорах, а на практике решает всё. Перед распознаванием DeepSeek приводит любую картинку к суммарной площади примерно как у квадрата 800 на 800 пикселей, то есть около 640 тысяч пикселей. Пропорции сохраняются, но всё, что было крупнее, сжимается.
Что это значит в цифрах:
| Что отправляешь | Исходный размер | Что видит модель |
|---|---|---|
| Скриншот экрана ноутбука | 1920 x 1080 | 1066 x 600 |
| Фото чека с телефона | 3000 x 4000 | 693 x 924 |
| Скан документа А4, 300 dpi | 2480 x 3508 | 673 x 951 |
Полноэкранный скриншот теряет почти половину линейного разрешения. Текст, который на экране был высотой 13 пикселей, приезжает семипиксельным, и модель начинает угадывать символы вместо чтения. Отсюда растут все жалобы вида «перепутал цифры в номере счёта».
Лечится это одним движением: не отправляй весь экран. Обрежь нужный блок интерфейса и пришли только его. Кроп 600 на 400 пикселей приедет к модели почти без потерь и будет стоить ровно столько же, потому что потолок в 384 токена от размера картинки не зависит.
Что модель прочитает плохо
- Скриншот всего рабочего стола с открытыми окнами
- Длинный чек из супермаркета одним кадром сверху донизу
- Таблица на 40 строк мелким шрифтом целиком
- Фото документа под углом с бликом от лампы
- Скан газетной полосы с колонками в 8 пунктов
Что прочитает уверенно
- Обрезанный фрагмент интерфейса с одной кнопкой и подписью
- Верх чека с датой, суммой и названием магазина
- Та же таблица, порезанная на три куска по 12 строк
- Документ снятый сверху, ровно, при дневном свете
- График или диаграмма с крупными подписями осей
Если задача повторяется, автоматизируй кроп. Скрипт на Python с библиотекой Pillow режет скриншот на плитки 800 на 600 с перекрытием в 50 пикселей и отправляет их пачкой в одном запросе: лимит в 600 картинок позволяет разложить так хоть многостраничный договор. Перекрытие нужно, чтобы строка на стыке не потерялась.
Как получить доступ из России
Модель живёт только на платформе для разработчиков. Бесплатного чата с картинками у DeepSeek нет, и на момент публикации компания не обещала его открыть. Хотя по прошлым релизам видно, что бесплатную версию они обычно выкатывают через несколько недель после платной.
Путь 1: OpenRouter ≈ 10 мин
- Модель лежит по слагу deepseek/deepseek-v4-flash-vision-exp
- Цена та же самая, 0,22 и 0,66 доллара за миллион
- Баланс пополняется криптой, зарубежная карта не нужна
- Один ключ открывает заодно сотню других моделей
Путь 2: прямой аккаунт DeepSeek ≈ 20 мин
- Регистрация на platform.deepseek.com, ключ выдаётся сразу
- Для пополнения нужна зарубежная карта или посредник
- Доступ к эндпоинту зависит от провайдера, у части абонентов рвётся
- Зато без наценки сверху и с полным набором параметров
Путь 3: российский агрегатор ≈ 5 мин
- Оплата обычной картой РФ, VPN не нужен вовсе
- Самый быстрый старт, если не хочется возиться с ключами
- Минус: наценка и задержка с появлением свежих моделей
- Экспериментальные версии приезжают туда позже всех
Первый путь для большинства читателей самый практичный: он снимает сразу и вопрос карты, и вопрос доступности домена. Как завести там аккаунт и не переплатить на комиссии, разобрано в гайде OpenRouter: как пользоваться.
Для второго пути понадобится либо рабочий VPN с устойчивым зарубежным IP, либо готовность к тому, что соединение будет рваться в самый неподходящий момент. Пополнить баланс без зарубежной карты помогает сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Остальные способы платить зарубежным сервисам собраны в отдельном разборе как оплатить нейросети из России.
Чеки, паспорта, договоры и медицинские выписки уезжают на серверы в Китай и попадают под их правила хранения. Для персональных данных клиентов это прямой риск. Если работаешь с чужими документами, либо замазывай персональные поля до отправки, либо смотри в сторону локальной модели: как это устроено, разобрано в гайде локальная нейросеть распознаёт фото.
Что реально можно поручить модели
Ниже сценарии, под которые Vision Exp подходит по своим характеристикам, с готовыми промптами. Цена каждого прогона держится в пределах копеек, поэтому эксперименты обходятся дёшево.
Чеки и накладные в таблицу
Модель поддерживает параметр response_format с выводом в JSON, поэтому ответ можно сразу класть в базу без парсинга текста.
Ты обрабатываешь фотографии чеков. С картинки сними: дату покупки, название магазина, ИНН, итоговую сумму, сумму НДС, список позиций с ценами. Верни строго JSON без пояснений и без markdown. Если поле не читается, поставь null и добавь его название в массив unreadable. Суммы возвращай числом, копейки после точки. Дату в формате ГГГГ-ММ-ДД.
Поле unreadable важнее, чем кажется. Без него модель дорисовывает правдоподобную цифру вместо смазанной, и ошибка уезжает в отчёт незамеченной.
Скриншоты интерфейсов и ошибок
На скриншоте окно программы. Опиши по пунктам: что это за экран, какие элементы управления видны и что написано на каждом, есть ли сообщение об ошибке и его точный текст. Названия кнопок и пункты меню цитируй буквально, символ в символ. Если надпись не читается однозначно, так и напиши вместо догадки.
Последнее предложение обязательное. Без прямого запрета на догадки любая мультимодальная модель уверенно выдаёт правдоподобный вариант надписи, и отличить его от настоящего по ответу нельзя.
Графики и дашборды
Chartography модель почти вытянула против Opus, 64,3 против 65,0, так что разбор диаграмм ей по силам.
На картинке график. Извлеки данные в таблицу: подписи осей, единицы измерения, все точки или столбцы со значениями. Затем отдельным абзацем: какой вывод следует из этих данных и какая деталь на графике может ввести в заблуждение (обрезанная ось, нелинейная шкала, разные периоды в сравнении).
Проверка вёрстки и опечаток
Дешевизна открывает сценарий, который на дорогих моделях не окупался: гонять пачками скриншоты собственных страниц.
Это скриншот страницы сайта. Найди и перечисли: опечатки и грамматические ошибки в видимом тексте, обрезанный или наезжающий друг на друга текст, элементы с разными отступами в одном ряду, кнопки без подписи. Каждую находку опиши так, чтобы было понятно, где именно на экране она находится.
Сто скриншотов страниц в такой проверке обойдутся примерно в 5 рублей.
Как проверить всё это самому за 15 минут
Все цифры бенчмарков выше замерял производитель, а наши расчёты сделаны по опубликованному прайсу. Единственный честный способ понять, годится ли модель под твои картинки, это прогнать на них свои же данные.
Порядок такой. Возьми ключ по любому из трёх путей выше. Собери десять реальных картинок из своей задачи: пять простых и пять заведомо трудных, со смазом, бликом и мелким шрифтом. Прогони их дважды: как есть и обрезанными по смыслу. Сравни ответы с тем, что написано на картинке на самом деле, и посчитай долю ошибок отдельно по каждой пачке.
Запрос устроен как обычный чат, картинка кладётся в массив content блоком image_url, обязательно внутри сообщения роли user: в system и assistant картинки запрещены и вернут ошибку 400.
Разницу между «как есть» и «обрезанным» считай обязательно. Именно она показывает, упирается модель в качество распознавания или в то самое сжатие до 800 на 800. В первом случае помогает смена модели, во втором достаточно поправить подготовку картинок, и это дешевле.
Чек-лист: что у тебя теперь есть
- Понимание, что именно вышло 21 августа 2026: экспериментальная модель со зрением, только по API, бесплатного чата с картинками нет.
- Честная картина по бенчмаркам: счёт 2:2 с Opus 4.8 на четырёх визуальных тестах, все цифры от производителя, независимой проверки нет.
- Цены в рублях по курсу ЦБ на 22 августа 2026 и посчитанный счёт за тысячу чеков: около 23 рублей в непиковые часы.
- Знание про сжатие до 800 на 800 пикселей и правило резать скриншоты на фрагменты вместо отправки всего экрана.
- Три пути доступа из России с честной оценкой минусов каждого.
- Четыре готовых промпта под чеки, скриншоты, графики и проверку вёрстки.
- Способ проверить модель на своих картинках за пятнадцать минут вместо доверия чужим обзорам.
Что с этим делать дальше
Если ты уже гоняешь распознавание документов через дорогую модель, посчитай свой месячный объём по таблице выше. При тысячах картинок в месяц разница в счёте получается в разы, иногда на порядок, и тестовый прогон на своих данных окупается за один вечер.
Если распознавание тебе нужно изредка, спешить некуда. Бесплатный чат DeepSeek картинки пока не принимает. Флагманы со встроенным зрением для разовых задач остаются удобнее. Смотри на эту новость как на индикатор: то, что вчера стоило дорого, дешевеет за месяцы, и планировать инфраструктуру вокруг сегодняшних цен на токены больше не имеет смысла.
По материалам: SiliconANGLE.
Частые вопросы
Что такое DeepSeek V4 Flash Vision Exp?
Экспериментальная мультимодальная модель DeepSeek, вышедшая 21 августа 2026. Первая модель компании, которая принимает на вход картинки вместе с текстом и отвечает текстом. Доступна только через платный API, в бесплатном чате на сайте и в приложении её нет. Контекст 1 млн токенов, до 600 картинок в одном запросе.
Сколько стоит распознать картинку через DeepSeek Vision?
Одна картинка стоит максимум 384 входных токена независимо от размера. По непиковому тарифу 0,22 доллара за миллион входных токенов это примерно 0,7 копейки за снимок. Тысяча чеков с коротким ответом по каждому обойдётся примерно в 23 рубля по курсу ЦБ на 22 августа 2026.
Правда ли DeepSeek Vision обошёл Claude Opus 4.8?
На четырёх визуальных бенчмарках счёт 2:2. Vision Exp выиграл ZeroBench (35,0 против 34,0) и Agents Last Exam (27,3 против 25,7), проиграл ApexBench (36,5 против 39,4) и Chartography (64,3 против 65,0). Все цифры замерял сам DeepSeek, независимой проверки пока нет.
Работает ли DeepSeek Vision из России?
Прямой доступ к API зависит от провайдера и требует зарубежной карты для пополнения. Надёжнее два обходных пути: шлюз OpenRouter, где модель лежит по той же цене и баланс пополняется криптой, либо российский агрегатор нейросетей за рубли. VPN нужен не всем, проверь свой канал сам.
Почему DeepSeek плохо читает мелкий текст на скриншотах?
Перед распознаванием любая картинка сжимается до суммарной площади примерно 800 на 800 пикселей. Скриншот 1920 на 1080 превращается в 1066 на 600, и текст размером 13 пикселей становится семипиксельным. Лечится обрезкой: отправляй нужный фрагмент интерфейса вместо всего экрана.