Инструменты · 18 мин · обновлено 28 июля 2026 г.

Своя нейросеть на компьютере через Ollama: ставим за 15 минут (2026)

Как за 15 минут поднять локальную нейросеть на своём компьютере через Ollama: установка на Windows, Mac и Linux, какие модели понимают русский, сколько нужно оперативной памяти, работает ли из России без VPN и бесплатно.

Своя нейросеть на компьютере через Ollama: ставим за 15 минут (2026)

Своя нейросеть на компьютере ставится за 15 минут через программу Ollama. Ты качаешь один установщик, вводишь одну команду в терминале, и на твоём Windows, Mac или Linux начинает работать языковая модель уровня ChatGPT попроще. Без интернета после установки, без VPN, без подписки и без единого рубля оплаты.

Это идеальный вариант для России: модель крутится на твоём железе, данные никуда не уходят, доступ никто не заблокирует. Ниже пошагово: что нужно от компьютера, как поставить Ollama на любую систему, какие модели понимают русский, как поднять локальный API и что делать, если ответы тормозят.

Ollama - бесплатная программа, которая запускает нейросети прямо на твоём компьютере. Установка занимает минуты: скачал установщик, ввёл команду `ollama run` и имя модели. После загрузки модель работает офлайн, без VPN и без оплаты, данные остаются у тебя. Для русского языка бери Qwen 2.5 или Gemma 2. Нужно от 8 ГБ оперативной памяти для лёгких моделей, видеокарта ускоряет, но не обязательна.

Словарик: термины, которые встретятся

Коротко: что важно знать

Что такое Ollama и зачем нужна локальная нейросеть

Ollama - это бесплатная программа с открытым кодом, которая берёт на себя всю возню с запуском нейросети на твоём компьютере. Ты не разбираешься в питоне, драйверах и форматах моделей. Ставишь Ollama, пишешь ollama run и имя модели, и через пару минут в терминале уже идёт диалог, как с ChatGPT.

Зачем это, когда есть облачные чаты. Для России четыре причины складываются в одну большую.

Минусы честно тоже назовём. Локальная модель на домашнем железе слабее топовых облачных: маленькая версия путается в сложных задачах и знает меньше фактов. Скорость упирается в твоё железо. И место на диске модели съедают быстро. Для тяжёлых задач облачный Claude или ChatGPT останутся сильнее, но для многого локальной модели хватает с запасом.

Слово Ollama часто путают с названием модели. Ollama - это только «движок», который запускает модели. А сами модели - Llama от Meta, Gemma от Google, Qwen от Alibaba, Phi от Microsoft, DeepSeek. Одна программа Ollama крутит любую из них, ты просто выбираешь имя в команде.

Что нужно от компьютера

Главный ресурс для локальной нейросети - оперативная память. Модель целиком загружается в память, и если её не хватает, компьютер начинает тормозить или откажется запускать модель. Видеокарта не обязательна, но с ней ответы идут в разы быстрее, потому что считать на видеочипе быстрее, чем на процессоре.

Ориентир по памяти под размер модели:

8ГБ ОЗУ

лёгкие модели 1-3B, например llama3.2 или phi3.5

16ГБ ОЗУ

средние модели 7-9B, например qwen2.5 или gemma2

32ГБ ОЗУ

крупные модели 13B и больше, ближе к облачному качеству

Про размер файла. Модель llama3.2 на 3 миллиарда параметров качается примерно на 2 ГБ, хотя в полном виде весила бы около 6 ГБ. Ollama по умолчанию берёт сжатую версию (квантизация 4 бита), она занимает на 60% меньше и почти не теряет в качестве. Именно поэтому небольшие модели помещаются на обычный ноутбук.

Про скорость. На современном Mac с чипом Apple Silicon или на компьютере с видеокартой NVIDIA лёгкая модель выдаёт 40 и больше токенов в секунду - читается как быстрая печать живого человека. На старом ноутбуке без видеокарты та же модель может ползти, и если ты видишь меньше 5 токенов в секунду, бери версию полегче.

Не знаешь свой объём памяти - посмотри быстро. На Windows: правой кнопкой по «Пуск» → «Система», строка «Оперативная память». На Mac: меню Apple → «Об этом Mac». Если там 8 ГБ, начинай с модели на 1-3 миллиарда параметров и не грузи ничего тяжелее, пока не поймёшь, как система тянет.

Ставим Ollama за 15 минут: Windows, Mac и Linux

Установка одинаково простая на всех системах. По сути это три шага: скачать программу, поставить, запустить первую модель.

Шаг 1 ≈ 3 мин

  • скачать установщик Ollama с сайта
  • Windows и Mac: обычный установщик
  • Linux: одна команда в терминале
1

Шаг 2 ≈ 2 мин

  • запустить установку
  • появится значок в трее или в строке меню
  • проверить командой ollama --version
2

Шаг 3 ≈ 5 мин

  • ввести ollama run и имя модели
  • дождаться загрузки весов
  • писать запрос прямо в терминал
3

Windows и Mac

Зайди на сайт ollama.com и скачай установщик под свою систему. Запусти его как любую программу. На Windows после установки Ollama появится маленький значок в системном трее у часов, на Mac - иконка в строке меню сверху. Это значит, что фоновый сервис запущен и готов.

Дальше открой терминал. На Windows это PowerShell или Командная строка, на Mac - программа Терминал. Проверь, что Ollama встала:

ollama --version

Если в ответ выводится номер версии, всё в порядке.

Linux

На Linux всё ставится одной командой в терминале. Скопируй и вставь:

curl -fsSL https://ollama.com/install.sh | sh

Скрипт сам скачает и настроит Ollama, включая поддержку видеокарты, если она есть. После этого так же проверь версию через ollama --version.

Команду установки бери только с официального сайта ollama.com. В сети гуляют чужие скрипты и «сборки Ollama» с левых сайтов - под видом установщика туда легко подложить лишнее. Официальный установщик и официальная команда `curl` с ollama.com - единственный безопасный путь. Каталог моделей тоже смотри на самом ollama.com.

Первый запуск: команда ollama run

Теперь самое интересное. Чтобы запустить нейросеть, введи в терминале ollama run и имя модели. Начнём с лёгкой и сбалансированной llama3.2:

ollama run llama3.2

При первом запуске Ollama скачает веса модели (для llama3.2 это около 2 ГБ), покажет полосу загрузки, а потом появится приглашение к диалогу. Пиши запрос прямо в терминал и жми Enter:

>>> Объясни простыми словами, что такое квантизация модели

Модель ответит прямо в терминале. Дальше это обычный диалог: задавай вопросы, проси переписать текст, объяснить код, накидать план. Чтобы выйти из чата, введи команду /bye.

Если захочешь модель побольше и поумнее, поменяй имя в команде. Несколько популярных вариантов:

ollama run gemma2:9b
ollama run qwen2.5:7b
ollama run phi3.5

Двоеточие с цифрой - это размер версии. gemma2:9b - это Gemma на 9 миллиардов параметров. Чем больше число, тем умнее модель и тем больше памяти ей нужно.

Поставил локальную модель и хочешь выжать из неё максимум? Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Какие локальные модели понимают русский

Тут кроется главная ловушка для нашего пользователя. Многие лёгкие модели заточены под английский и на русском отвечают коряво: путают падежи, вставляют английские слова, теряют смысл. Поэтому модель под русский надо выбирать осознанно.

По опыту, из того, что ставится в Ollama одной командой, русский язык лучше всего держат эти:

МодельКомандаРусскийДля чего берут
Qwen 2.5ollama run qwen2.5:7bочень хорошоуниверсал, силён в русском и коде
Gemma 2ollama run gemma2:9bхорошотексты, объяснения, аккуратные ответы
DeepSeek-R1ollama run deepseek-r1:7bхорошорассуждения, математика, код
Llama 3.2ollama run llama3.2среднелёгкая и быстрая, но русский слабее
Phi 3.5ollama run phi3.5среднекомпактная, для слабого железа

Правило простое: если русский важен, начинай с qwen2.5 или gemma2. Если железо слабое и памяти мало, бери llama3.2 или phi3.5, но будь готов, что на русском они местами промахиваются. И общая закономерность: чем больше параметров у модели, тем аккуратнее русский, но тем мощнее нужен компьютер.

Qwen и DeepSeek - китайские модели, у нас про них есть отдельные разборы облачных версий: DeepSeek: как пользоваться из России и Qwen: как пользоваться из России. Локальная версия отличается тем, что работает офлайн и данные не уходят на серверы в Китай, а это для чувствительных задач большой плюс.

Хочешь, чтобы модель точно отвечала по-русски - попроси её об этом прямо в первом сообщении: «Отвечай на русском языке». Маленькие модели иногда сползают на английский после длинного диалога, и такая явная инструкция возвращает их обратно. Как формулировать запросы, чтобы модель понимала с первого раза, разобрано в гайде [как писать промпты](/guides/kak-pisat-prompty).

Полезные команды Ollama

Кроме run у Ollama есть несколько команд, которые пригодятся каждый день. Все вводятся в терминале.

Скачать модель заранее, не запуская диалог (удобно на быстром интернете, чтобы потом работать офлайн):

ollama pull qwen2.5:7b

Посмотреть, какие модели уже скачаны и сколько места занимают:

ollama list

Проверить, какая модель сейчас загружена в память и работает:

ollama ps

Удалить модель, которая больше не нужна, и освободить место на диске:

ollama rm llama3.2

Эти четыре команды закрывают почти всё: скачал, посмотрел список, проверил и удалил лишнее. Модели съедают гигабайты быстро, так что ollama list и ollama rm держи под рукой.

Ollama как локальный API для своих программ

Тут начинается настоящая мощь. Ollama не только чат в терминале - она поднимает на твоём компьютере локальный сервер по адресу localhost:11434, к которому можно подключать свои программы, скрипты и боты. Причём этот сервер совместим с форматом OpenAI, а значит многие готовые инструменты подключаются к нему без переделок.

Проверить, что API работает, можно прямо из терминала. Пока запущена Ollama, выполни:

curl http://localhost:11434/api/generate -d '{"model":"llama3.2","prompt":"Привет"}'

В ответ пойдёт поток текста от модели. Это тот же ответ, что и в чате, только уже в виде данных, которые может принять твоя программа.

Что это даёт на практике. Ты можешь встроить локальную нейросеть в свой скрипт обработки текстов, подключить её к редактору кода, к боту или к приложению для заметок - и всё это будет работать офлайн и бесплатно. Многие инструменты, которые обычно ходят в платный OpenAI, умеют вместо него смотреть на localhost:11434.

Если терминал не твоё и хочется привычного окна чата, поверх Ollama ставится графическая оболочка. Популярные варианты - Open WebUI (веб-интерфейс как у ChatGPT, ставится отдельно) и десктопные приложения вроде LM Studio или Msty. Они подключаются к тому же локальному серверу и дают кнопки вместо команд.

Главное про Ollama: одна программа запускает нейросеть на твоём компьютере офлайн и бесплатно, а заодно поднимает локальный API, к которому подключаются твои скрипты и приложения. Данные не уходят с машины, доступ не зависит ни от VPN, ни от провайдера.

Работает ли Ollama из России без VPN

Короткий ответ: сама модель - да, всегда, потому что она уже на твоём компьютере и в интернет не ходит. Это и есть главный плюс локального запуска для России. Никакой блокировки, никакого VPN, никакой платёжной возни. Скачал один раз - и работаешь хоть в самолёте.

Единственный момент, где может понадобиться сеть, - это загрузка. Тебе нужно один раз скачать саму программу Ollama с ollama.com и веса моделей. По состоянию на июль 2026 сайт ollama.com и загрузка моделей из России обычно открываются напрямую, без VPN. Скорость зависит от провайдера и может проседать на больших файлах.

Если установщик или модель качаются совсем медленно или сайт не открывается, есть простые обходы:

Важно понять разницу с облачными чатами вроде ChatGPT и Claude. Там VPN и оплата нужны постоянно, каждый сеанс. Здесь сеть нужна ровно один раз, на скачивание. После этого локальная модель - самый устойчивый к блокировкам способ пользоваться нейросетью из России. Про другие способы работать без смены IP собран отдельный разбор: нейросети без VPN: чем пользоваться из России.

Не жди от локальной модели знания свежих новостей. Модель знает мир только на момент, когда её обучали, и в интернет за свежими фактами не ходит - в этом и смысл офлайна. Цены, события, курсы валют она может уверенно выдумать. Для актуальных данных нужен облачный чат с доступом в сеть или отдельный поиск.

Скорость и что делать, если модель тормозит

Локальная модель упирается в железо, и иногда ответы идут медленно или рвутся. Разбираем по причинам, отталкиваясь от типичных проблем.

СимптомПричинаЧто делать
ответ ползёт медленноне хватает памяти или нет видеокартызакрой тяжёлые программы, возьми модель полегче
ошибка драйвера видеокартыстарые драйверыобнови драйверы видеокарты
«address already in use»сервис уже занял порт 11434Ollama уже запущена в фоне, просто пиши команду ollama run
модель не влезает в памятьмодель тяжелее твоего железавыбери версию с меньшим числом параметров
ответ на английскоммаленькая модель сползладобавь в запрос «отвечай на русском»

Общее правило по скорости: если ответ идёт мучительно долго, дело почти всегда в размере модели относительно твоего железа. Спустись на ступень вниз - с 9B на 7B, с 7B на 3B. Потеряешь немного в уме модели, но получишь живую скорость. Лучше быстрая модель, которой реально пользуешься, чем умная, ответа от которой ждёшь минуту.

Локальная модель через Ollama

  • бесплатно и без подписки навсегда
  • работает офлайн, без VPN
  • данные не уходят с компьютера
  • никто не заблокирует по IP

Чего у неё нет

  • слабее топовых облачных на сложных задачах
  • не знает свежих новостей и не ходит в сеть
  • скорость упирается в твоё железо
  • тяжёлые модели требуют мощного компьютера

Частые ошибки новичка с Ollama

Грабли, на которые чаще всего наступают при первом запуске локальной нейросети.

Берут слишком тяжёлую модель под своё железо. Скачал 13B на ноутбук с 8 ГБ памяти - и всё встало колом. Смотри на объём памяти и подбирай размер модели под него, а не наоборот.

Ставят англоязычную модель и разочаровываются в русском. Маленькая Llama на русском промахивается, и человек решает, что «локальные модели не умеют по-русски». На деле надо было взять Qwen или Gemma. Модель под язык подбирают отдельно.

Ждут от офлайн-модели свежих фактов. Спрашивают про вчерашнюю новость или текущий курс - и получают выдумку. Локальная модель знает мир только до момента обучения, за свежим - в облако.

Забывают чистить диск. Каждая скачанная модель весит гигабайты. Пять моделей из любопытства - и диск забит. Регулярно смотри ollama list и удаляй ненужное через ollama rm.

Скачивают Ollama с левых сайтов. Только официальный ollama.com. Чужие сборки и скрипты установки - лишний риск.

Проверь, что всё работает

Быстрый способ убедиться, что локальная нейросеть настроена правильно. Запусти модель под русский и задай контрольный запрос:

ollama run qwen2.5:7b
>>> Ответь одним абзацем на русском: какая ты модель и работаешь ли ты сейчас офлайн, без интернета?

Если модель ответила по-русски, внятно и назвала себя - установка удалась, язык в порядке, модель работает локально. Для полной проверки офлайна можно отключить интернет и задать вопрос ещё раз: ответ всё равно придёт, потому что модель уже на твоём компьютере. Две галочки - русский и работа без сети - и можно переходить к реальным задачам.

Чек-лист: у тебя работает локальная нейросеть, если

Локальная модель поставлена и работает. Дальше её можно превратить в полноценное рабочее место: подключить к редактору, к заметкам, к своим скриптам. Как собрать вокруг нейросети рабочее пространство на компьютере, разобрано в гайде как собрать ИИ-воркспейс на компьютере. А если хочешь глянуть, что вообще доступно бесплатно и без вложений, держи подборку бесплатные нейросети 2026.

По материалам Machine Learning Mastery, «Run a Local AI Model with Ollama in 15 Minutes»: https://machinelearningmastery.com/run-a-local-ai-model-with-ollama-in-15-minutes/. Команды и технические детали сверены с официальной документацией Ollama по состоянию на июль 2026.

Рассылка

Подпишись на еженедельную рассылку

Полезные материалы и скиллы, которые усилят твою работу с нейросетями и помогут больше зарабатывать. Раз в неделю, без воды и спама.

Частые вопросы

Нужен ли VPN, чтобы пользоваться Ollama в России?

Для работы модели - нет. После того как ты один раз скачал Ollama и саму модель, всё крутится на твоём компьютере офлайн, интернет вообще не нужен. VPN может понадобиться только на этапе загрузки, если сайт ollama.com у твоего провайдера открывается медленно. Скачал один раз - дальше работаешь без сети и без VPN.

Сколько оперативной памяти нужно для локальной нейросети?

Для маленьких моделей на 1-3 миллиарда параметров хватает 8 ГБ оперативной памяти. Модели на 7-9 миллиардов комфортно идут на 16 ГБ. Для моделей на 13 миллиардов и больше нужно 32 ГБ. Видеокарта не обязательна, но с ней ответы идут в разы быстрее. Начни с лёгкой модели и смотри по скорости.

Какая локальная модель лучше понимает русский язык?

Из того, что ставится в Ollama одной командой, по русскому языку сильнее всего Qwen 2.5 и Gemma 2, хорошо тянет DeepSeek-R1. Llama на русском слабее, особенно маленькие версии. Правило простое: чем больше параметров у модели, тем аккуратнее русский, но тем мощнее нужно железо.

Ollama бесплатная?

Да, полностью. Сама программа Ollama и все модели в её каталоге скачиваются и работают бесплатно, карта и подписка не нужны. Ты платишь только за электричество, которое тратит компьютер. Это главное отличие от ChatGPT и Claude, где за доступ или лимиты берут деньги.

Можно ли запустить локальную нейросеть без видеокарты?

Да. Ollama работает и на одном процессоре, модель считается на нём. Ответы будут идти медленнее, чем с видеокартой, но маленькие модели на 1-3 миллиарда параметров остаются пригодными для работы. Если ответ ползёт меньше 5 слов в секунду - возьми модель полегче.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.

Пройти мини-курс