Инструменты · 17 мин · обновлено 14 августа 2026 г.

Локальная нейросеть и картинки: распознать фото, чек и скриншот офлайн (2026)

Как научить нейросеть на своём компьютере смотреть на картинки: какие модели видят изображения, сколько нужно памяти, как скормить фото через терминал и Python и как получить ответ строгим JSON. Бесплатно, офлайн, без VPN.

17 мин чтения

Локальная нейросеть и картинки: распознать фото, чек и скриншот офлайн (2026)

Локальная нейросеть умеет смотреть на картинки, если взять модель со зрением. Ставится это на обычный компьютер за десять минут, работает бесплатно и офлайн, а на вход можно подавать фото документа, скриншот ошибки, снимок чека или кадр с телефона и получать по нему текстовый разбор. Из моделей, которые ставятся одной командой, картинки понимают Gemma 3 от 4 миллиардов параметров, Qwen2.5-VL и Llama 3.2 Vision.

Главная ловушка тут одна: обычная текстовая модель картинку не видит вообще. Ты передашь ей файл, она бодро ответит и ни разу не сознается, что смотрела только на твой текст. Разница между «модель со зрением» и «модель без зрения» решает всё остальное.

Чтобы локальная нейросеть работала с изображениями, нужна мультимодальная модель: в каталоге Ollama это Gemma 3 от 4 миллиардов параметров и старше, Qwen2.5-VL и Llama 3.2 Vision. Картинка передаётся путём к файлу в терминале или полем images из Python. К памяти модели прибавляется 1-3 ГБ на кодировщик изображений, минимальный рабочий набор заводится на 8 ГБ ОЗУ. Всё считается на твоём компьютере: бесплатно, офлайн, без VPN и без подписки. Цифры с фото модель домысливает, суммы и номера надо перепроверять.

Словарик: пять терминов, без которых будет каша

  • Мультимодальная модель (VLM) - модель, которая принимает на вход и текст, и изображение. Второе название - vision-модель, или «модель со зрением».
  • Кодировщик изображений - часть модели, которая превращает картинку в набор чисел, понятный языковой части. Именно он ест дополнительные гигабайты памяти.
  • Проектор (mmproj) - файл-переходник между кодировщиком и языковой частью. Если он не подключён, модель запустится и будет отвечать текстом, а картинку проигнорирует.
  • Квантование - сжатие модели, чтобы влезала в память. Q4 означает четыре бита на число вместо шестнадцати, размер падает примерно вчетверо.
  • Структурированный ответ - режим, когда модель обязана вернуть строгий JSON по заданной схеме вместо свободного текста.

Коротко: что важно знать

  • Зрение есть не у всех: текстовая модель картинку не увидит, нужна отдельная vision-версия.
  • Минимум железа: gemma3:4b занимает около 2,6 ГБ в Q4 и работает на ноутбуке с 8 ГБ ОЗУ.
  • Плата за зрение: кодировщик изображений добавляет 1-3 ГБ поверх обычного веса модели.
  • Скорость: первый ответ приходит через 2-5 секунд на видеокарте и через 4-8 секунд на процессоре.
  • Русский текст на фото: крупные надписи читаются, мелкие цифры домысливаются.
  • Деньги: ноль. Ни подписки, ни карты, ни лимитов на количество картинок.

Что локальная модель со зрением реально умеет

Разберём честно, без обещаний. Модель на 4-12 миллиардов параметров, запущенная дома, уверенно делает четыре вещи.

Описывает содержимое кадра: что за объект, сколько предметов, какая обстановка, что происходит. Читает крупный видимый текст: вывеску, заголовок документа, название на упаковке, надпись на скриншоте. Отвечает на вопрос по картинке: «есть ли тут кошка», «какого цвета папка справа», «какая ошибка на экране». И раскладывает увиденное по полочкам, если попросить строгий формат ответа.

Автор материала на Towards Data Science собрал на локальной модели разбор фотоархива из поездки: скормил семь снимков по одному и получил по каждому узнанную достопримечательность, прочитанный видимый текст, определённых животных, подпись и настроение кадра. Дальше он собрал из этих разборов связный рассказ о поездке, и тоже локально, без единого запроса в облако.

Чего локальная модель делать не умеет: точно считать мелкие цифры. Сумма в чеке, номер счёта, показания счётчика, дата на штампе - всё это маленькая модель домысливает с уверенным лицом. Любую цифру, полученную с картинки, сверяй глазами. Если распознавание сумм нужно в потоке, бери специализированный OCR, а не общую vision-модель.

Что нужно от компьютера

Правило простое: считаешь память как для обычной модели того же размера, потом прибавляешь на кодировщик изображений.

2,6ГБ

Gemma 3 на 4 миллиарда параметров в четырёхбитном сжатии, минимальный рабочий вариант

6ГБ

Qwen2.5-VL на 7 миллиардов, рабочая лошадка по документам

14ГБ

Gemma 3 на 27 миллиардов, лучшее качество разбора в домашнем классе

Видеокарта не обязательна. Модель посчитается и на процессоре, просто первый ответ придёт через 4-8 секунд вместо 2-5. Для разовых задач разница незаметна, для потока в сотню картинок она превращается в лишние полчаса ожидания.

Отдельная тонкость про оперативную память. Если видеокарты нет, модель целиком грузится в ОЗУ, и 8 ГБ на весь компьютер при модели в 2,6 ГБ - это впритык, но живо. Хочешь работать с картинками комфортно, планируй 16 ГБ. Мы подробно разбирали, что и на каком железе тянет, в гайде про нейросети на видеокарте 8 ГБ.

Какие локальные модели видят картинки

Данные по требованиям к видеопамяти приведены для четырёхбитного сжатия, по обзору локальных vision-моделей InsiderLLM на август 2026.

МодельКомандаПамять (Q4)В чём сильна
Gemma 3 4Bollama run gemma3:4b~2,6 ГБсамый лёгкий вход, живёт без видеокарты
Gemma 3 12Bollama run gemma3:12b~6,6 ГБровный универсал, хорошо с неанглийским текстом
Gemma 3 27Bollama run gemma3:27b~14 ГБлучший разбор смысла картинки в домашнем классе
Qwen2.5-VL 7Bollama run qwen2.5vl:7b~6 ГБдокументы, таблицы, скриншоты интерфейсов
Qwen3-VL 8Bollama run qwen3-vl:8b~6 ГБсхемы, графики, распознавание текста
Llama 3.2 Vision 11Bollama run llama3.2-vision~8 ГБпошаговые рассуждения по картинке

Что из этого брать под задачу. Если картинка - это документ, таблица, скриншот программы или что угодно с плотным текстом, бери линейку Qwen-VL: она заточена под чтение. Если картинка бытовая, то есть фото, кадр, предмет, сцена, и важно понимание смысла, бери Gemma 3. У Gemma 3 есть приятный бонус для нас: она обучена на 140+ языках и заметно спокойнее относится к надписям не на английском, включая русские вывески и заголовки.

Llama 3.2 Vision в 2026 году уже подвинули модели Qwen, но она никуда не делась и на своих задачах работает.

Список моделей со зрением удобно смотреть прямо в каталоге Ollama: на странице моделей есть фильтр Vision, и он оставляет только те, что понимают картинки.

Каталог Ollama с включённым фильтром Vision: модели kimi-k3, muse-glimmer, qwen3.8 и gemma4 с метками vision
Каталог ollama.com с фильтром Vision, снимок от 14 августа 2026. У каждой модели видны метки: vision означает поддержку картинок, рядом счётчик загрузок и дата обновления.

Каталог заметно живее таблицы выше. На середину августа 2026 в списке со зрением лежат Gemma 4 (размеры e2b, e4b, 12b, 26b, 31b), Qwen3.8 на 27 миллиардов, Kimi K3 и Meta Muse Glimmer на 30 миллиардов под лицензией Apache 2.0. Модели из таблицы проверены временем и хорошо документированы, поэтому для первого запуска брать стоит их. А если хочется свежего, фильтр Vision в каталоге всегда покажет текущий набор.

Число рядом с именем модели - это количество параметров, а не версия. Запись gemma3:4b означает Gemma 3 на 4 миллиарда параметров. У Gemma 3 пять размеров (270m, 1b, 4b, 12b, 27b), и зрение появляется начиная с 4b. Маленькие 270m и 1b работают только с текстом, сколько картинок им ни подсовывай.

Локальная модель разбирает картинки, а собрать из этого рабочий процесс - отдельный навык. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Как скормить картинку модели: три способа

Дальше считаем, что Ollama у тебя уже стоит. Если ещё нет, поставь по нашему разбору как поднять нейросеть на компьютере через Ollama, это минут пятнадцать, и возвращайся сюда.

Скачать модель со зрением ≈ 5 мин

  • команда ollama pull gemma3:4b
  • около 3 ГБ загрузки
  • качается один раз, дальше живёт локально
1

Проверить, что зрение работает ≈ 1 мин

  • дать любую картинку с крупной надписью
  • спросить, что на ней написано
  • ответ мимо - значит картинка не дошла
2

Подобрать формат ответа ≈ 5 мин

  • свободный текст для чтения глазами
  • строгий JSON для обработки программой
  • температура ноль для повторяемости
3

Способ первый: терминал

Самый быстрый. Запускаешь модель и пишешь путь к файлу прямо в строке вопроса:

ollama run gemma3:4b
>>> Что написано на этой вывеске? /Users/ilya/Desktop/foto.png

Путь можно не набирать руками: перетащи файл мышкой в окно терминала, и он подставится сам. Работает и на Mac, и на Windows, и в Linux.

Тот же вопрос можно задать одной строкой, без входа в диалог:

ollama run gemma3:4b "Опиши, что на картинке, тремя предложениями" ~/Desktop/foto.png

Способ второй: Python

Когда картинок больше пяти, руками их гонять бессмысленно. Ставим библиотеку и пишем цикл:

pip install ollama pillow

Картинка уходит модели списком в поле images:

import ollama

answer = ollama.chat(
    model="gemma3:4b",
    messages=[{
        "role": "user",
        "content": "Прочитай текст на картинке и назови тип документа.",
        "images": ["/Users/ilya/Desktop/foto.png"],
    }],
    options={"temperature": 0},
)
print(answer["message"]["content"])

temperature: 0 тут не украшение. На нуле модель отвечает на одну и ту же картинку одинаково, и результат можно сравнивать между прогонами. На дефолтной температуре два запуска подряд дадут два разных описания, и ты будешь гадать, что изменилось.

Способ третий: окно без терминала

Если терминал раздражает, поставь LM Studio: там модель выбирается мышкой из списка, а картинка просто перетаскивается в окно чата. Разницу между тремя движками мы разбирали в гайде Ollama, LM Studio или llama.cpp. Для картинок у LM Studio есть один практический плюс: он берёт модели с Hugging Face, где vision-версий заметно больше, чем в каталоге Ollama.

Прогони картинки через уменьшение перед подачей модели. Фото с телефона на 12 мегапикселей всё равно ужмётся внутри до размера, который понимает кодировщик, но сделает это как получится. Уменьши сам до 1024 пикселей по длинной стороне библиотекой pillow, и получишь два выигрыша: предсказуемый результат и заметно быстрее ответ.

Строгий JSON вместо болтовни

Пока ты читаешь ответы глазами, свободный текст удобен. Как только картинок становится сто, нужен формат, который умеет читать программа. У Ollama для этого есть параметр format: ты отдаёшь модели схему ответа, и она обязана уложиться в неё.

Схему удобно описывать через pydantic:

from pydantic import BaseModel
import ollama, json

class PhotoInfo(BaseModel):
    doc_type: str
    visible_text: str
    has_people: bool
    summary: str

answer = ollama.chat(
    model="qwen2.5vl:7b",
    messages=[{"role": "user", "content": "Разбери картинку.",
               "images": ["foto.png"]}],
    format=PhotoInfo.model_json_schema(),
    options={"temperature": 0},
)
data = PhotoInfo.model_validate_json(answer["message"]["content"])
print(data.doc_type, data.has_people)

На выходе получается объект с полями, а не абзац текста. Дальше его можно складывать в таблицу, фильтровать, искать по нему.

Формула: модель со зрением плюс уменьшенная картинка плюс температура ноль плюс схема ответа. Убери любой из четырёх множителей, и результат перестанет быть повторяемым.

Промпты, которые работают с картинками

Общее правило: чем конкретнее вопрос, тем меньше модель фантазирует. «Опиши картинку» даёт красивое сочинение. «Назови марку прибора на фото и его серийный номер, если он виден» даёт факты.

Посмотри на изображение и ответь строго по пунктам:
1. Что это за документ или объект.
2. Весь текст, который реально виден на картинке, дословно.
3. Чего на картинке нет, но что обычно бывает у таких документов.
Если какой-то пункт определить нельзя, напиши «не видно». Не додумывай.

Фраза про «не видно» тут ключевая. Без неё модель заполнит пробелы правдоподобной выдумкой, потому что её так учили: давать связный ответ.

Второй рабочий шаблон - разбор скриншота с ошибкой:

На скриншоте окно программы с ошибкой. Ответь:
 
Текст ошибки дословно:
Что программа пыталась сделать:
Три вероятные причины, от самой частой к редкой:
Что проверить первым делом:
 
Пиши коротко, без вступлений.

Третий - опись коробки, папки, полки:

Составь список предметов на фото. Для каждого укажи:
название, примерное количество, состояние (новое, б/у, повреждено).
Верни ответ таблицей. Предметы, в которых не уверен, помечай знаком вопроса.

Что делать, если модель не видит картинку

Самая частая поломка выглядит так: модель отвечает бодро и по теме, но по содержанию картинки промахивается полностью. Значит, изображение до неё не дошло, и она сочиняет по одному твоему тексту.

Проверяется за минуту: возьми картинку с крупной уникальной надписью и спроси, что на ней написано. Угадала - зрение работает. Ответила вокруг да около - зрение не подключено.

Причины по частоте:

  1. Взята текстовая модель. gemma3:1b и llama3.2 картинки не видят в принципе. Нужна версия со зрением.
  2. Не подключён проектор. Модель скачана вручную с Hugging Face одним файлом, без соседнего mmproj. Именно на это напоролся автор исходного материала: он собирал Gemma 4 E4B в Ollama 0.32.5 под Windows, и модель отказывалась использовать визуальную часть, пока он не подтянул отдельный файл проектора mmproj-BF16.gguf из репозитория Unsloth рядом с квантованной моделью. Сейчас этот танец уже не нужен: Gemma 4 лежит в каталоге Ollama с меткой vision и ставится обычной командой.
  3. Модель свежая, а Ollama её зрение ещё не завёл. Такое случалось летом 2026 с Qwen 3.5 и 3.6: текстовая часть грузилась, а mmproj к ней не подключался, и картинки не работали. К августу дыру закрыли, Qwen3.8 в каталоге идёт с меткой vision. Но правило осталось: если модель вышла на днях, зрение у неё в Ollama может быть ещё не собрано. Лечится переходом на llama.cpp или LM Studio, либо выбором модели, у которой метка vision уже стоит.
  4. Битый путь к файлу. Пробел в имени папки без кавычек, и путь превращается в два аргумента. Перетаскивание файла мышкой снимает эту проблему.

Не собирай модель из отдельных gguf-файлов вручную, если можешь взять готовый тег из каталога Ollama. Ручная сборка - главный источник ситуации «модель работает, зрение молчит», и отладить её без понимания, что такое проектор, почти нереально.

Локально или в облаке: что честнее

Чего у локальной модели нет

  • качества облачных моделей на сложных картинках
  • надёжного счёта мелких цифр и сумм
  • скорости на потоке в тысячи изображений
  • работы на слабом ноутбуке без запаса памяти

Что она реально даёт

  • ноль рублей за любое количество картинок
  • фото не уходят на чужие серверы
  • работу без интернета, VPN и карты
  • предсказуемый результат при температуре ноль

Приватность тут главный аргумент. Когда речь про паспорт, договор, медицинскую выписку или внутренние скриншоты рабочей системы, вопрос «а куда уехал этот файл» перестаёт быть теоретическим. Локальная модель отвечает на него однозначно: никуда. Можно физически выдернуть сеть и проверить.

Второй аргумент - деньги. Разбор тысячи картинок через облачный API стоит ощутимых денег и требует зарубежной карты. Дома тысяча картинок стоит ровно столько электричества, сколько компьютер сожрёт за час работы.

Если же задача - обработать фото красиво, а не понять их содержание, локальная модель тут ни при чём. Для ретуши, апскейла и замены фона есть отдельные инструменты, мы собрали их в гайде про нейросети для обработки фото.

Работает ли это из России

Работает, и это тот редкий случай, когда ничего обходить не нужно.

После загрузки модель считается на твоём процессоре или видеокарте. Интернет можно выключить совсем: ни один байт наружу не уходит, потому что уходить некуда. Ни аккаунта, ни подписки, ни карты, ни привязки к номеру.

Сеть нужна ровно один раз, на скачивание. Каталог Ollama из России обычно открывается напрямую. Hugging Face местами капризничает у отдельных провайдеров, и тогда VPN пригодится только на время загрузки файла, после чего его снова можно выключить. Что ещё доступно без обходных путей, разобрано в гайде про нейросети без VPN в России.

Отдельно про специализированный OCR. Если задача сводится к «вытащить текст из документа с сохранением вёрстки», общая vision-модель избыточна. Модель PaddleOCR-VL размером меньше миллиарда параметров крутится на одном процессоре, знает 109 языков и по замерам OmniDocBench даёт около 92,6% точности на документах. Для потока сканов это правильнее, чем гонять Gemma.

Проверь, что всё работает

Пять шагов, каждый занимает меньше минуты.

  1. Выполни ollama list и убедись, что нужная модель в списке.
  2. Сделай скриншот любой страницы с крупным заголовком.
  3. Спроси у модели, какой заголовок на картинке.
  4. Сравни ответ с оригиналом дословно.
  5. Отключи интернет и повтори шаг третий: ответ должен прийти как ни в чём не бывало.

Пятый шаг важнее остальных. Он доказывает, что ты действительно работаешь локально, а не через какой-нибудь незаметно подключённый облачный ключ.

Чек-лист: у тебя работает локальное зрение, если

  • поставлена модель со зрением, а название и размер ты знаешь наизусть;
  • картинка доходит до модели, и проверка крупной надписью это подтверждает;
  • ответ повторяется от прогона к прогону, потому что температура выставлена в ноль;
  • большие фото уменьшаются перед подачей и уходят в модель уже лёгкими;
  • для потока настроен строгий JSON, и разбирает его программа;
  • цифры и суммы с картинок проходят человеческую проверку перед отчётом;
  • интернет выключен, а модель продолжает отвечать.

Дальше по нарастающей: связать разбор картинок с папкой на диске, чтобы новые файлы разбирались сами, и складывать результат в таблицу. Это уже обычный скрипт на двадцать строк поверх того, что ты собрал сегодня.

По материалам Towards Data Science: Building Multimodal Workflows with a Local LLM.

Частые вопросы

Может ли локальная нейросеть смотреть картинки?

Да, но только специальные модели с так называемым зрением. В каталоге Ollama это Gemma 3 от 4 миллиардов параметров и выше, Qwen2.5-VL, Qwen3-VL и Llama 3.2 Vision. Обычная текстовая модель картинку не увидит, даже если ты передашь ей файл: она ответит по названию файла и по твоему тексту.

Сколько памяти нужно локальной модели, чтобы работать с фото?

К обычным требованиям модели прибавляется ещё 1-3 ГБ на кодировщик изображений. Самый лёгкий рабочий вариант, Gemma 3 на 4 миллиарда параметров, занимает около 2,6 ГБ в четырёхбитном сжатии, то есть заводится на ноутбуке с 8 ГБ оперативной памяти. Модели на 7-12 миллиардов просят 6-7 ГБ видеопамяти.

Как передать картинку модели в Ollama?

В терминале путь к файлу пишется прямо в строке запроса после текста, например: ollama run gemma3:4b и дальше вопрос плюс путь к png. Файл можно перетащить мышкой в окно терминала, путь подставится сам. Из Python картинка передаётся списком в поле images внутри вызова ollama.chat.

Читает ли локальная модель русский текст на фото?

Читает, но с оговорками. Крупные надписи, заголовки документов и вывески распознаются нормально. Мелкий шрифт, рукописный текст и смазанные чеки модель домысливает, особенно в цифрах. Любую сумму и любой номер после распознавания надо сверять глазами, автоматически доверять им нельзя.

Нужен ли VPN для локальной нейросети с картинками?

Для самой работы нет: после загрузки модель считается на твоём компьютере полностью офлайн, интернет можно выключить. Сеть нужна один раз, чтобы скачать модель. Каталог Ollama из России обычно открывается напрямую, а вот Hugging Face местами капризничает, и тогда VPN нужен только на время скачивания файла.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.