Своя нейросеть на компьютере через Ollama: ставим за 15 минут (2026)
Как за 15 минут поднять локальную нейросеть на своём компьютере через Ollama: установка на Windows, Mac и Linux, какие модели понимают русский, сколько нужно оперативной памяти, работает ли из России без VPN и бесплатно.
Своя нейросеть на компьютере ставится за 15 минут через программу Ollama. Ты качаешь один установщик, вводишь одну команду в терминале, и на твоём Windows, Mac или Linux начинает работать языковая модель уровня ChatGPT попроще. Без интернета после установки, без VPN, без подписки и без единого рубля оплаты.
Это идеальный вариант для России: модель крутится на твоём железе, данные никуда не уходят, доступ никто не заблокирует. Ниже пошагово: что нужно от компьютера, как поставить Ollama на любую систему, какие модели понимают русский, как поднять локальный API и что делать, если ответы тормозят.
Ollama - бесплатная программа, которая запускает нейросети прямо на твоём компьютере. Установка занимает минуты: скачал установщик, ввёл команду `ollama run` и имя модели. После загрузки модель работает офлайн, без VPN и без оплаты, данные остаются у тебя. Для русского языка бери Qwen 2.5 или Gemma 2. Нужно от 8 ГБ оперативной памяти для лёгких моделей, видеокарта ускоряет, но не обязательна.
Словарик: термины, которые встретятся
- Ollama - бесплатная программа, которая скачивает и запускает нейросети на твоём компьютере. Работает через терминал одной командой.
- Локальная модель - нейросеть, которая считается на твоём железе, а не на чужом сервере. Отсюда приватность и работа офлайн.
- Веса модели - файл с «мозгами» нейросети, который ты скачиваешь один раз. Лёгкая модель весит около 2 ГБ, тяжёлая - десятки гигабайт.
- Параметры (B) - размер модели в миллиардах связей.
llama3.2на 3B - это 3 миллиарда параметров. Чем больше, тем умнее и тяжелее. - Квантизация - сжатие модели, чтобы она влезла в память обычного компьютера. Ollama по умолчанию грузит сжатую версию, она занимает на 60% меньше места.
- Токены в секунду - скорость выдачи ответа. 40 токенов в секунду читаются как быстрая печать, ниже 5 - модель ползёт, пора взять полегче.
- API на localhost - способ подключить локальную модель к своим программам. Ollama открывает адрес
localhost:11434прямо на твоём компьютере.
Коротко: что важно знать
- Установка - 15 минут: скачать Ollama и запустить одну команду.
- Работает офлайн: после загрузки модели интернет не нужен вообще.
- Бесплатно и без VPN: ни подписки, ни карты, ни смены IP.
- Русский язык: сильнее всего Qwen 2.5 и Gemma 2, слабее Llama.
- Железо: от 8 ГБ оперативной памяти для лёгких моделей, видеокарта ускоряет.
- Приватность: данные не уходят с компьютера, серверов нет.
Что такое Ollama и зачем нужна локальная нейросеть
Ollama - это бесплатная программа с открытым кодом, которая берёт на себя всю возню с запуском нейросети на твоём компьютере. Ты не разбираешься в питоне, драйверах и форматах моделей. Ставишь Ollama, пишешь ollama run и имя модели, и через пару минут в терминале уже идёт диалог, как с ChatGPT.
Зачем это, когда есть облачные чаты. Для России четыре причины складываются в одну большую.
- Работает офлайн. Скачал модель один раз, дальше интернет не нужен. Самолёт, дача без связи, отключили сеть - нейросеть на месте.
- Никто не заблокирует. Модель на твоём диске, её нельзя отрезать по IP или закрыть по санкциям. Доступ не зависит от провайдера и VPN.
- Приватность. Твои тексты, код и документы не улетают на чужой сервер. Для чувствительных задач это решает.
- Бесплатно навсегда. Ни подписки, ни карты. Заплатил один раз за компьютер - и пользуйся.
Минусы честно тоже назовём. Локальная модель на домашнем железе слабее топовых облачных: маленькая версия путается в сложных задачах и знает меньше фактов. Скорость упирается в твоё железо. И место на диске модели съедают быстро. Для тяжёлых задач облачный Claude или ChatGPT останутся сильнее, но для многого локальной модели хватает с запасом.
Слово Ollama часто путают с названием модели. Ollama - это только «движок», который запускает модели. А сами модели - Llama от Meta, Gemma от Google, Qwen от Alibaba, Phi от Microsoft, DeepSeek. Одна программа Ollama крутит любую из них, ты просто выбираешь имя в команде.
Что нужно от компьютера
Главный ресурс для локальной нейросети - оперативная память. Модель целиком загружается в память, и если её не хватает, компьютер начинает тормозить или откажется запускать модель. Видеокарта не обязательна, но с ней ответы идут в разы быстрее, потому что считать на видеочипе быстрее, чем на процессоре.
Ориентир по памяти под размер модели:
лёгкие модели 1-3B, например llama3.2 или phi3.5
средние модели 7-9B, например qwen2.5 или gemma2
крупные модели 13B и больше, ближе к облачному качеству
Про размер файла. Модель llama3.2 на 3 миллиарда параметров качается примерно на 2 ГБ, хотя в полном виде весила бы около 6 ГБ. Ollama по умолчанию берёт сжатую версию (квантизация 4 бита), она занимает на 60% меньше и почти не теряет в качестве. Именно поэтому небольшие модели помещаются на обычный ноутбук.
Про скорость. На современном Mac с чипом Apple Silicon или на компьютере с видеокартой NVIDIA лёгкая модель выдаёт 40 и больше токенов в секунду - читается как быстрая печать живого человека. На старом ноутбуке без видеокарты та же модель может ползти, и если ты видишь меньше 5 токенов в секунду, бери версию полегче.
Не знаешь свой объём памяти - посмотри быстро. На Windows: правой кнопкой по «Пуск» → «Система», строка «Оперативная память». На Mac: меню Apple → «Об этом Mac». Если там 8 ГБ, начинай с модели на 1-3 миллиарда параметров и не грузи ничего тяжелее, пока не поймёшь, как система тянет.
Ставим Ollama за 15 минут: Windows, Mac и Linux
Установка одинаково простая на всех системах. По сути это три шага: скачать программу, поставить, запустить первую модель.
Шаг 1 ≈ 3 мин
- скачать установщик Ollama с сайта
- Windows и Mac: обычный установщик
- Linux: одна команда в терминале
Шаг 2 ≈ 2 мин
- запустить установку
- появится значок в трее или в строке меню
- проверить командой ollama --version
Шаг 3 ≈ 5 мин
- ввести ollama run и имя модели
- дождаться загрузки весов
- писать запрос прямо в терминал
Windows и Mac
Зайди на сайт ollama.com и скачай установщик под свою систему. Запусти его как любую программу. На Windows после установки Ollama появится маленький значок в системном трее у часов, на Mac - иконка в строке меню сверху. Это значит, что фоновый сервис запущен и готов.
Дальше открой терминал. На Windows это PowerShell или Командная строка, на Mac - программа Терминал. Проверь, что Ollama встала:
ollama --version
Если в ответ выводится номер версии, всё в порядке.
Linux
На Linux всё ставится одной командой в терминале. Скопируй и вставь:
curl -fsSL https://ollama.com/install.sh | sh
Скрипт сам скачает и настроит Ollama, включая поддержку видеокарты, если она есть. После этого так же проверь версию через ollama --version.
Команду установки бери только с официального сайта ollama.com. В сети гуляют чужие скрипты и «сборки Ollama» с левых сайтов - под видом установщика туда легко подложить лишнее. Официальный установщик и официальная команда `curl` с ollama.com - единственный безопасный путь. Каталог моделей тоже смотри на самом ollama.com.
Первый запуск: команда ollama run
Теперь самое интересное. Чтобы запустить нейросеть, введи в терминале ollama run и имя модели. Начнём с лёгкой и сбалансированной llama3.2:
ollama run llama3.2
При первом запуске Ollama скачает веса модели (для llama3.2 это около 2 ГБ), покажет полосу загрузки, а потом появится приглашение к диалогу. Пиши запрос прямо в терминал и жми Enter:
>>> Объясни простыми словами, что такое квантизация модели
Модель ответит прямо в терминале. Дальше это обычный диалог: задавай вопросы, проси переписать текст, объяснить код, накидать план. Чтобы выйти из чата, введи команду /bye.
Если захочешь модель побольше и поумнее, поменяй имя в команде. Несколько популярных вариантов:
ollama run gemma2:9b
ollama run qwen2.5:7b
ollama run phi3.5
Двоеточие с цифрой - это размер версии. gemma2:9b - это Gemma на 9 миллиардов параметров. Чем больше число, тем умнее модель и тем больше памяти ей нужно.
Поставил локальную модель и хочешь выжать из неё максимум? Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Какие локальные модели понимают русский
Тут кроется главная ловушка для нашего пользователя. Многие лёгкие модели заточены под английский и на русском отвечают коряво: путают падежи, вставляют английские слова, теряют смысл. Поэтому модель под русский надо выбирать осознанно.
По опыту, из того, что ставится в Ollama одной командой, русский язык лучше всего держат эти:
| Модель | Команда | Русский | Для чего берут |
|---|---|---|---|
| Qwen 2.5 | ollama run qwen2.5:7b | очень хорошо | универсал, силён в русском и коде |
| Gemma 2 | ollama run gemma2:9b | хорошо | тексты, объяснения, аккуратные ответы |
| DeepSeek-R1 | ollama run deepseek-r1:7b | хорошо | рассуждения, математика, код |
| Llama 3.2 | ollama run llama3.2 | средне | лёгкая и быстрая, но русский слабее |
| Phi 3.5 | ollama run phi3.5 | средне | компактная, для слабого железа |
Правило простое: если русский важен, начинай с qwen2.5 или gemma2. Если железо слабое и памяти мало, бери llama3.2 или phi3.5, но будь готов, что на русском они местами промахиваются. И общая закономерность: чем больше параметров у модели, тем аккуратнее русский, но тем мощнее нужен компьютер.
Qwen и DeepSeek - китайские модели, у нас про них есть отдельные разборы облачных версий: DeepSeek: как пользоваться из России и Qwen: как пользоваться из России. Локальная версия отличается тем, что работает офлайн и данные не уходят на серверы в Китай, а это для чувствительных задач большой плюс.
Хочешь, чтобы модель точно отвечала по-русски - попроси её об этом прямо в первом сообщении: «Отвечай на русском языке». Маленькие модели иногда сползают на английский после длинного диалога, и такая явная инструкция возвращает их обратно. Как формулировать запросы, чтобы модель понимала с первого раза, разобрано в гайде [как писать промпты](/guides/kak-pisat-prompty).
Полезные команды Ollama
Кроме run у Ollama есть несколько команд, которые пригодятся каждый день. Все вводятся в терминале.
Скачать модель заранее, не запуская диалог (удобно на быстром интернете, чтобы потом работать офлайн):
ollama pull qwen2.5:7b
Посмотреть, какие модели уже скачаны и сколько места занимают:
ollama list
Проверить, какая модель сейчас загружена в память и работает:
ollama ps
Удалить модель, которая больше не нужна, и освободить место на диске:
ollama rm llama3.2
Эти четыре команды закрывают почти всё: скачал, посмотрел список, проверил и удалил лишнее. Модели съедают гигабайты быстро, так что ollama list и ollama rm держи под рукой.
Ollama как локальный API для своих программ
Тут начинается настоящая мощь. Ollama не только чат в терминале - она поднимает на твоём компьютере локальный сервер по адресу localhost:11434, к которому можно подключать свои программы, скрипты и боты. Причём этот сервер совместим с форматом OpenAI, а значит многие готовые инструменты подключаются к нему без переделок.
Проверить, что API работает, можно прямо из терминала. Пока запущена Ollama, выполни:
curl http://localhost:11434/api/generate -d '{"model":"llama3.2","prompt":"Привет"}'
В ответ пойдёт поток текста от модели. Это тот же ответ, что и в чате, только уже в виде данных, которые может принять твоя программа.
Что это даёт на практике. Ты можешь встроить локальную нейросеть в свой скрипт обработки текстов, подключить её к редактору кода, к боту или к приложению для заметок - и всё это будет работать офлайн и бесплатно. Многие инструменты, которые обычно ходят в платный OpenAI, умеют вместо него смотреть на localhost:11434.
Если терминал не твоё и хочется привычного окна чата, поверх Ollama ставится графическая оболочка. Популярные варианты - Open WebUI (веб-интерфейс как у ChatGPT, ставится отдельно) и десктопные приложения вроде LM Studio или Msty. Они подключаются к тому же локальному серверу и дают кнопки вместо команд.
Главное про Ollama: одна программа запускает нейросеть на твоём компьютере офлайн и бесплатно, а заодно поднимает локальный API, к которому подключаются твои скрипты и приложения. Данные не уходят с машины, доступ не зависит ни от VPN, ни от провайдера.
Работает ли Ollama из России без VPN
Короткий ответ: сама модель - да, всегда, потому что она уже на твоём компьютере и в интернет не ходит. Это и есть главный плюс локального запуска для России. Никакой блокировки, никакого VPN, никакой платёжной возни. Скачал один раз - и работаешь хоть в самолёте.
Единственный момент, где может понадобиться сеть, - это загрузка. Тебе нужно один раз скачать саму программу Ollama с ollama.com и веса моделей. По состоянию на июль 2026 сайт ollama.com и загрузка моделей из России обычно открываются напрямую, без VPN. Скорость зависит от провайдера и может проседать на больших файлах.
Если установщик или модель качаются совсем медленно или сайт не открывается, есть простые обходы:
- скачать в момент, когда сеть посвободнее (ночью, с другого провайдера);
- временно включить VPN только на время загрузки, а дальше работать без него;
- взять модель заранее командой
ollama pullна быстром интернете, а потом пользоваться офлайн где угодно.
Важно понять разницу с облачными чатами вроде ChatGPT и Claude. Там VPN и оплата нужны постоянно, каждый сеанс. Здесь сеть нужна ровно один раз, на скачивание. После этого локальная модель - самый устойчивый к блокировкам способ пользоваться нейросетью из России. Про другие способы работать без смены IP собран отдельный разбор: нейросети без VPN: чем пользоваться из России.
Не жди от локальной модели знания свежих новостей. Модель знает мир только на момент, когда её обучали, и в интернет за свежими фактами не ходит - в этом и смысл офлайна. Цены, события, курсы валют она может уверенно выдумать. Для актуальных данных нужен облачный чат с доступом в сеть или отдельный поиск.
Скорость и что делать, если модель тормозит
Локальная модель упирается в железо, и иногда ответы идут медленно или рвутся. Разбираем по причинам, отталкиваясь от типичных проблем.
| Симптом | Причина | Что делать |
|---|---|---|
| ответ ползёт медленно | не хватает памяти или нет видеокарты | закрой тяжёлые программы, возьми модель полегче |
| ошибка драйвера видеокарты | старые драйверы | обнови драйверы видеокарты |
| «address already in use» | сервис уже занял порт 11434 | Ollama уже запущена в фоне, просто пиши команду ollama run |
| модель не влезает в память | модель тяжелее твоего железа | выбери версию с меньшим числом параметров |
| ответ на английском | маленькая модель сползла | добавь в запрос «отвечай на русском» |
Общее правило по скорости: если ответ идёт мучительно долго, дело почти всегда в размере модели относительно твоего железа. Спустись на ступень вниз - с 9B на 7B, с 7B на 3B. Потеряешь немного в уме модели, но получишь живую скорость. Лучше быстрая модель, которой реально пользуешься, чем умная, ответа от которой ждёшь минуту.
Локальная модель через Ollama
- бесплатно и без подписки навсегда
- работает офлайн, без VPN
- данные не уходят с компьютера
- никто не заблокирует по IP
Чего у неё нет
- слабее топовых облачных на сложных задачах
- не знает свежих новостей и не ходит в сеть
- скорость упирается в твоё железо
- тяжёлые модели требуют мощного компьютера
Частые ошибки новичка с Ollama
Грабли, на которые чаще всего наступают при первом запуске локальной нейросети.
Берут слишком тяжёлую модель под своё железо. Скачал 13B на ноутбук с 8 ГБ памяти - и всё встало колом. Смотри на объём памяти и подбирай размер модели под него, а не наоборот.
Ставят англоязычную модель и разочаровываются в русском. Маленькая Llama на русском промахивается, и человек решает, что «локальные модели не умеют по-русски». На деле надо было взять Qwen или Gemma. Модель под язык подбирают отдельно.
Ждут от офлайн-модели свежих фактов. Спрашивают про вчерашнюю новость или текущий курс - и получают выдумку. Локальная модель знает мир только до момента обучения, за свежим - в облако.
Забывают чистить диск. Каждая скачанная модель весит гигабайты. Пять моделей из любопытства - и диск забит. Регулярно смотри ollama list и удаляй ненужное через ollama rm.
Скачивают Ollama с левых сайтов. Только официальный ollama.com. Чужие сборки и скрипты установки - лишний риск.
Проверь, что всё работает
Быстрый способ убедиться, что локальная нейросеть настроена правильно. Запусти модель под русский и задай контрольный запрос:
ollama run qwen2.5:7b
>>> Ответь одним абзацем на русском: какая ты модель и работаешь ли ты сейчас офлайн, без интернета?
Если модель ответила по-русски, внятно и назвала себя - установка удалась, язык в порядке, модель работает локально. Для полной проверки офлайна можно отключить интернет и задать вопрос ещё раз: ответ всё равно придёт, потому что модель уже на твоём компьютере. Две галочки - русский и работа без сети - и можно переходить к реальным задачам.
Чек-лист: у тебя работает локальная нейросеть, если
- поставил Ollama с официального сайта и проверил
ollama --version; - знаешь объём своей оперативной памяти и подобрал размер модели под него;
- запустил первую модель через
ollama runи получил ответ в терминале; - выбрал модель под русский -
qwen2.5илиgemma2, а не толькоllama3.2; - умеешь пользоваться командами
pull,list,psиrm; - проверил, что модель отвечает офлайн, с отключённым интернетом.
Локальная модель поставлена и работает. Дальше её можно превратить в полноценное рабочее место: подключить к редактору, к заметкам, к своим скриптам. Как собрать вокруг нейросети рабочее пространство на компьютере, разобрано в гайде как собрать ИИ-воркспейс на компьютере. А если хочешь глянуть, что вообще доступно бесплатно и без вложений, держи подборку бесплатные нейросети 2026.
По материалам Machine Learning Mastery, «Run a Local AI Model with Ollama in 15 Minutes»: https://machinelearningmastery.com/run-a-local-ai-model-with-ollama-in-15-minutes/. Команды и технические детали сверены с официальной документацией Ollama по состоянию на июль 2026.
Рассылка
Подпишись на еженедельную рассылку
Полезные материалы и скиллы, которые усилят твою работу с нейросетями и помогут больше зарабатывать. Раз в неделю, без воды и спама.
человек уже подписались
Готово! Ты в списке.
Первое письмо придёт в ближайшую рассылку. Отписка в один клик.
Частые вопросы
Нужен ли VPN, чтобы пользоваться Ollama в России?
Для работы модели - нет. После того как ты один раз скачал Ollama и саму модель, всё крутится на твоём компьютере офлайн, интернет вообще не нужен. VPN может понадобиться только на этапе загрузки, если сайт ollama.com у твоего провайдера открывается медленно. Скачал один раз - дальше работаешь без сети и без VPN.
Сколько оперативной памяти нужно для локальной нейросети?
Для маленьких моделей на 1-3 миллиарда параметров хватает 8 ГБ оперативной памяти. Модели на 7-9 миллиардов комфортно идут на 16 ГБ. Для моделей на 13 миллиардов и больше нужно 32 ГБ. Видеокарта не обязательна, но с ней ответы идут в разы быстрее. Начни с лёгкой модели и смотри по скорости.
Какая локальная модель лучше понимает русский язык?
Из того, что ставится в Ollama одной командой, по русскому языку сильнее всего Qwen 2.5 и Gemma 2, хорошо тянет DeepSeek-R1. Llama на русском слабее, особенно маленькие версии. Правило простое: чем больше параметров у модели, тем аккуратнее русский, но тем мощнее нужно железо.
Ollama бесплатная?
Да, полностью. Сама программа Ollama и все модели в её каталоге скачиваются и работают бесплатно, карта и подписка не нужны. Ты платишь только за электричество, которое тратит компьютер. Это главное отличие от ChatGPT и Claude, где за доступ или лимиты берут деньги.
Можно ли запустить локальную нейросеть без видеокарты?
Да. Ollama работает и на одном процессоре, модель считается на нём. Ответы будут идти медленнее, чем с видеокартой, но маленькие модели на 1-3 миллиарда параметров остаются пригодными для работы. Если ответ ползёт меньше 5 слов в секунду - возьми модель полегче.