Инструменты · 22 мин · обновлено 11 августа 2026 г.

Нейросеть на своём ПК: 8 моделей, которые тянет видеокарта с 8 ГБ (2026)

Какие локальные нейросети реально работают на видеокарте с 8 ГБ памяти: восемь моделей с цифрами по занятой памяти и скорости, формула расчёта, установка через Ollama и LM Studio. Бесплатно, офлайн, без VPN и зарубежной карты.

22 мин чтения

Нейросеть на своём ПК: 8 моделей, которые тянет видеокарта с 8 ГБ (2026)

На видеокарте с 8 ГБ памяти реально работают модели на 7-9 миллиардов параметров в четырёхбитном сжатии. Лучший универсал на август 2026 года это Qwen3.5 9B: занимает 6,96 ГБ, выдаёт 54,9 токена в секунду и целиком влезает в карту. Бесплатно, офлайн, без VPN и без зарубежной карты.

Всё, что больше 9 миллиардов параметров, на 8 ГБ уже начинает сбрасывать слои на процессор, и скорость обваливается в разы. Ниже восемь моделей, которые проверенно живут в этих рамках, с цифрами по памяти и скорости, и одна формула, чтобы прикинуть любую новую модель самому.

Потолок видеокарты на 8 ГБ это модели на 7-9 миллиардов параметров в квантовании Q4. Формула прикидки: миллиарды параметров умножить на 0,6 плюс 1,5 ГБ на контекст. Универсал 2026 года Qwen3.5 9B (6,96 ГБ, 54,9 токена в секунду), для кода Qwen2.5-Coder 7B, для рассуждений DeepSeek-R1 8B, для слабых карт Llama 3.2 3B. Ставится всё одной командой через Ollama, работает офлайн и бесплатно.

Словарик: термины, которые встретятся

  • VRAM (видеопамять) - память на самой видеокарте. Именно в неё должна поместиться модель, чтобы работать быстро. Оперативная память компьютера это другое.
  • Параметры (B) - размер модели в миллиардах настраиваемых чисел. 8B значит 8 миллиардов. Больше параметров это обычно умнее, но тяжелее.
  • Квантование (Q4, Q4_K_M) - сжатие модели, когда каждое число хранят в 4 битах вместо 16. Модель худеет примерно вчетверо, качество проседает слабо. Стандарт для домашних карт.
  • KV-кэш - память под историю диалога. Растёт по мере разговора и съедает видеопамять сверх веса самой модели.
  • Токен - кусочек текста примерно в 3-4 буквы. Скорость модели меряют в токенах в секунду, комфорт чтения начинается где-то с 15-20.
  • Сброс слоёв (offload) - когда модель не влезла в видеокарту и часть её считает процессор. Работать будет, но медленно.

Коротко: что важно знать

Вес файла модели и занятая видеопамять это разные числа. Файл Qwen3.5 9B в Q4 весит около 5 ГБ, а в работе на контексте 32 тысячи токенов модель занимает почти 7 ГБ. Разницу съедает KV-кэш.

Часть видеопамяти всегда занята рабочим столом и браузером. На Windows это обычно 0,5-1 ГБ, и планировать надо от 7 доступных гигабайт, не от 8.

Модель, которая влезла целиком, работает в 5-10 раз быстрее модели, которая влезла на 90 процентов. Деградация тут не плавная. Это обрыв.

Почему всё упирается в 8 ГБ, при чём тут мощность карты

Локальная нейросеть считается быстро только тогда, когда все её слои лежат в видеопамяти. Как только хотя бы часть уезжает в оперативную память, каждый шаг генерации ждёт медленную шину между процессором и видеокартой.

По замерам на RTX 3070 с движком llama.cpp даже 4 слоя из 63, ушедшие на процессор, режут скорость выдачи примерно на 70 процентов. Пропорция тут не работает: доля слоёв 6 процентов, потеря скорости 70.

Поэтому вопрос выбора модели для карты на 8 ГБ сводится к одному: влезает или нет. Мощность чипа при этом почти не решает, RTX 4060 не спасёт от лишнего гигабайта.

Ориентируйся по занятой видеопамяти в работе. Вес файла модели обманывает. Модель на 5 ГБ на диске легко разрастается до 7 ГБ при длинном диалоге за счёт KV-кэша. Если в мониторинге видеопамять уткнулась в потолок, а скорость упала до пары токенов в секунду, значит слои уехали на процессор.

Второй едок памяти это сам рабочий стол. Оконный менеджер, браузер с десятком вкладок и мессенджер спокойно держат 0,5-1,5 ГБ видеопамяти. Автор оригинального разбора на MakeUseOf отдельно отмечает, что часть памяти уходит на обслуживание графической оболочки, и это ест ресурс, который мог бы работать на модель.

Восьми гигабайт просто недостаточно для локального ИИ.

- Sydney Butler, MakeUseOf

Формулировка резкая, и в части больших моделей она верна. Но восемь гигабайт закрывают весь класс задач, ради которых люди вообще ставят нейросеть локально: переписка без утечки данных, черновики текстов, разбор своих файлов, помощь по коду и работа без интернета.

Как понять, влезет ли модель в твою видеокарту

Считать вручную не нужно, хватает грубой прикидки. Она ошибается процентов на десять, и этого достаточно, чтобы не качать зря 9 гигабайт.

Формула: нужная видеопамять в ГБ ≈ миллиарды параметров × 0,6 + 1,5 ГБ на контекст. Для карты на 8 ГБ реальный бюджет это 7 ГБ, остальное держит рабочий стол.

Проверим на живых числах. Модель на 9 миллиардов: 9 × 0,6 = 5,4, плюс 1,5 на контекст, получается 6,9 ГБ. Замер на RTX 3070 дал 6,96 ГБ. Модель на 12 миллиардов: 12 × 0,6 = 7,2, плюс 1,5, получается 8,7 ГБ, и это уже мимо. Реальный замер Gemma 3 12B на той же карте показал 10,02 ГБ.

Множитель 0,6 работает для квантования Q4_K_M. Для Q5 бери 0,75, для Q8 бери 1,2, для несжатой модели в FP16 бери 2,0. Отсюда и правило: на 8 ГБ качаешь Q4, всё остальное роскошь.

Если модель не влезает на пару сотен мегабайт, сначала попробуй урезать контекст до 8 тысяч токенов вместо 32 тысяч. Это освобождает около гигабайта и часто решает вопрос без перехода на модель поменьше. В Ollama это переменная `num_ctx`, в LM Studio ползунок Context Length.

Таблица: 8 моделей для видеокарты на 8 ГБ

Все цифры по памяти и скорости ниже относятся к квантованию Q4_K_M. Замеры видеопамяти и скорости для класса 9-14B взяты с тестового стенда на RTX 3070 (8 ГБ) с контекстом 32 тысячи токенов, публикация LocalLLM, 2026 год.

МодельКоманда OllamaПараметрыПамятьДля чего берут
Qwen3.5 9Bollama run qwen3.5:9b9B≈ 7,0 ГБУниверсал, лучший русский, инструменты и агенты
Qwen3 8Bollama run qwen3:8b8B≈ 6,3 ГБРассуждения с режимом размышления
Llama 3.1 8Bollama run llama3.1:8b8B≈ 6,3 ГБКлассика, максимум совместимости с гайдами
DeepSeek-R1 8Bollama run deepseek-r1:8b8B≈ 6,3 ГБЛогика и задачи по шагам
Mistral 7Bollama run mistral:7b7B≈ 5,7 ГББыстрые черновики и художественный текст
Qwen2.5-Coder 7Bollama run qwen2.5-coder:7b7B≈ 5,7 ГБКод, отладка, объяснение чужого кода
Gemma 3 4Bollama run gemma3:4b4B≈ 4,0 ГБЛёгкая, понимает картинки на входе
Llama 3.2 3Bollama run llama3.2:3b3B≈ 3,3 ГБКарты на 4-6 ГБ и старые ноутбуки

Дальше по каждой модели по делу: в чём сила, где проваливается и кому она реально нужна.

1. Qwen3.5 9B: главный универсал 2026 года

Если ставить одну модель и больше не думать, ставь эту. На карте с 8 ГБ она единственная из класса 9B, которая помещается целиком: 6,96 ГБ при контексте 32 тысячи токенов и 54,9 токена в секунду на RTX 3070.

Пятьдесят токенов в секунду это быстрее, чем ты читаешь. Ответ появляется потоком без пауз, ощущение работы примерно как у облачного чата.

Отдельная сила модели это вызов инструментов. Если ты собираешь домашнего агента, который ходит по файлам, дёргает скрипты и возвращает результат, Qwen3.5 9B на этом уровне памяти самая предсказуемая. Про сборку таких агентов есть отдельный разбор в гайде про ИИ-агентов для новичка.

Русский язык она держит лучше всех соседей по списку. Падежи, согласование, деловой тон без калек с английского.

У Qwen3.5 в каталоге Ollama четыре размера: 0.8b, 2b, 4b и 9b. Для карты на 8 ГБ бери 9b, для 6 ГБ версию 4b. Промежуточных вариантов на 7 миллиардов у этой линейки нет.

2. Qwen3 8B: когда важнее рассуждения, чем скорость

Предыдущее поколение той же линейки, и оно всё ещё в строю по одной причине: режим размышления. Модель сначала прогоняет цепочку мыслей и только потом выдаёт ответ, и на задачах с несколькими шагами это заметно поднимает точность.

Занимает около 6,3 ГБ, оставляя запас под браузер. Скорость ниже, чем у 9B, потому что часть токенов уходит в размышление, которое ты не видишь.

Берут её под задачи вида «разбери условие, посчитай, проверь себя»: планирование, разбор таблиц, логические задачки. Для обычной переписки она избыточна, размышления просто съедают время.

У линейки Qwen3 в каталоге есть версии на 0.6b, 1.7b, 4b, 8b, 14b, 30b и 32b. На 8 ГБ твой потолок это 8b, всё выше уедет на процессор.

Локальная модель отлично закрывает рутину, но сложные задачи всё равно уходят на большие модели. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

3. Llama 3.1 8B: классика, под которую написаны все гайды

Модель Meta на 8 миллиардов держится в топе загрузок Ollama с огромным отрывом: больше 118 миллионов скачиваний против 33 миллионов у Qwen3. И это её главное преимущество на сегодня.

Под Llama 3.1 8B написано всё: настройки, системные промпты, готовые конфиги, интеграции с плагинами. Если ты гуглишь ошибку, ответ найдётся именно про неё.

По качеству она сейчас середняк. Ровное общее знание, спокойное поведение, никаких сюрпризов. Русский заметно слабее, чем у Qwen, особенно на длинных текстах: сбивается на английские обороты и путает падежи.

Занимает около 6,3 ГБ в Q4, что комфортно для 8 ГБ. Отдельно её любят на видеокартах AMD, там она лучше всего оптимизирована под стек ROCm.

Чего от локальной модели ждать не стоит

  • Свежих новостей и цен: знания оборваны на дате обучения
  • Уровня облачных моделей на сложных задачах
  • Длинных документов без просадки скорости
  • Идеальной работы с редкими терминами на русском

Что реально даёт

  • Полную приватность: ни один текст не уходит наружу
  • Работу офлайн, в самолёте и на даче без сети
  • Ноль рублей за запросы и отсутствие лимитов
  • Обработку сотен файлов подряд без счёта за API

4. DeepSeek-R1 8B: думает вслух

Это дистиллят большой рассуждающей модели, ужатый до 8 миллиардов параметров. Он показывает свою цепочку мыслей прямо в ответе: сначала рассуждает, перебирает варианты, спорит сам с собой, потом выдаёт вывод.

Полезнее всего это в двух случаях. Первый: тебе нужна сама логика, по которой модель пришла к ответу, например при разборе задачи с ребёнком или проверке своего решения. Второй: ты отлаживаешь промпт и хочешь увидеть, где модель свернула не туда.

Расплата это ощущение медлительности. До первого слова полезного ответа может пройти полминуты, пока идёт размышление. Занимает около 6,3 ГБ.

Модель самая скачиваемая в своей категории: линейка DeepSeek-R1 в каталоге Ollama перевалила за 91 миллион загрузок. Про облачную версию того же семейства и её ограничения из России есть отдельный гайд по DeepSeek.

5. Mistral 7B: быстрый текст и черновики

Французская модель, старая по меркам 2026 года, но живучая. Причина в характере: она быстрая, лёгкая и охотно пишет.

На черновиках, письмах, описаниях товаров и художественных зарисовках она приятнее многих ровесников. Меньше канцелярита, живее фразы, реже уходит в списки там, где нужен связный текст.

Занимает около 5,7 ГБ, оставляя больше гигабайта запаса под контекст и рабочий стол. Контекст ограничен 32 тысячами токенов, что для домашних задач достаточно.

Слабое место это точность. На фактах, вычислениях и многошаговых задачах она уступает свежим восьмимиллиардным моделям. Русский средний: пишет бегло, но с ошибками в согласовании.

6. Qwen2.5-Coder 7B: код и разбор чужих скриптов

Модель, дообученная специально на коде. На карте с 8 ГБ она лучший вариант под программирование: 5,7 ГБ, быстрая генерация, понимание больше двадцати языков программирования.

Что она делает хорошо: дописывает функции по началу, объясняет чужой код построчно, находит опечатки и логические дыры, переписывает под другой стиль, генерирует тесты.

Что делает плохо: всё, что не код. Просить её написать пост или письмо бессмысленно, ответы получаются сухими и рваными. Это узкий инструмент.

В каталоге Ollama у линейки есть версии на 0.5b, 1.5b, 3b, 7b, 14b и 32b. Для 8 ГБ потолок это 7b. Если тебе нужен разбор задач посложнее, смотри подборку в гайде про нейросети для программиста.

Локальная модель для кода сильнее всего окупается на приватных проектах, где код нельзя отдавать в облако. Рабочий сценарий такой: тяжёлую архитектуру продумываешь с большой облачной моделью, а рутину вроде дописывания функций и генерации тестов отдаёшь локальной, бесплатно и без лимитов.

7. Gemma 3 4B: лёгкая и понимает картинки

Модель Google на 4 миллиарда параметров, около 4 ГБ видеопамяти. Занимает половину карты, и это её смысл: остаётся запас под большой контекст, браузер и вторую программу.

Главная особенность это работа с изображениями на входе. Ты кидаешь скриншот и спрашиваешь, что на нём. Среди моделей такого размера, живущих на домашней карте, это редкость.

Качество текста ожидаемо ниже восьмимиллиардных. Она годится для перевода, пересказа, коротких ответов, разбора картинок и быстрой сортировки текстов. На сложных рассуждениях сыпется.

Линейка Gemma 3 в каталоге Ollama есть в размерах 270m, 1b, 4b и 12b. Версия 12b на карту с 8 ГБ уже не помещается, и об этом ниже отдельно.

8. Llama 3.2 3B: для карт на 4-6 ГБ и старых ноутбуков

Восьмая позиция для тех, у кого памяти меньше восьми гигабайт. Модель на 3 миллиарда параметров занимает около 3,3 ГБ и заводится почти на всём, включая ноутбучные GTX 1650 и встроенную графику.

Ждать от неё разговоров о смысле жизни не надо. Её задачи: перевод, краткий пересказ, переформулировка, сортировка по категориям, простые ответы на вопросы по короткому тексту.

Зато она мгновенная. На нормальной карте счёт идёт на сотни токенов в секунду, ответ появляется целиком почти сразу.

В той же весовой категории есть Qwen3.5 2B, у которой русский лучше, и Granite 4 на 3 миллиарда от IBM. Если Llama 3.2 плохо справляется с русским в твоих задачах, попробуй Qwen3.5 2B той же командой с другим тегом.

Что будет, если всё-таки взять модель побольше

Соблазн понятный: Gemma 3 12B и Phi-4 14B умнее всего списка выше. Проблема в том, что на 8 ГБ они превращаются в слайд-шоу. Цифры с того же стенда на RTX 3070, контекст 32 тысячи токенов:

Скорость выдачи на RTX 3070 (8 ГБ), токенов в секунду

Qwen3.5 9B
54,9
GLM-4.6V-Flash
17,4
Nemotron Nano 12B
6,6
Gemma 3 12B
4,3
Phi-4 14B
1,8

Разница между первой и последней строкой это тридцать раз. Phi-4 14B требует 11,22 ГБ и уводит на процессор 17 слоёв из 41, Gemma 3 12B требует 10,02 ГБ и уводит 26 слоёв из 49.

Полтора токена в секунду это примерно одно слово каждые две секунды. Ответ на абзац будет собираться пять минут. Пользоваться этим невозможно, каким бы умным ни был результат.

70%

падение скорости, когда на процессор уезжают всего 4 слоя из 63

6,96ГБ

занимает Qwen3.5 9B при контексте 32 тысячи токенов

1,8т/с

выдаёт Phi-4 14B на той же карте, это непригодно для работы

Вывод простой: на 8 ГБ модель на 9 миллиардов параметров практически всегда полезнее модели на 14 миллиардов. Умнее та, которая успевает ответить.

Как поставить любую из этих моделей за 10 минут

Проще всего через Ollama. Одна программа, одна команда, дальше работает офлайн.

Скачать движок ≈ 3 мин

  • Зайти на ollama.com и скачать установщик под свою систему
  • Windows, Mac и Linux поддерживаются одинаково
  • Из России сайт обычно открывается напрямую
1

Проверить видеокарту ≈ 1 мин

  • Windows: диспетчер задач, вкладка Производительность, строка Выделенная память графического процессора
  • Записать реальный объём и вычесть 1 ГБ на рабочий стол
2

Скачать модель ≈ 5 мин

  • Открыть терминал и выполнить команду из таблицы выше
  • Первый запуск качает веса, дальше модель стартует за секунды
  • Файл на 5 ГБ на обычном домашнем интернете идёт 4-8 минут
3

Замерить скорость ≈ 2 мин

  • Задать любой вопрос и посмотреть на темп появления слов
  • Меньше 10 токенов в секунду означает, что слои ушли на процессор
  • В этом случае брать модель на ступень меньше
4

Если терминал не твоя история, ставь LM Studio: там окно с чатом, список моделей и ползунки настроек мышкой. Подробное сравнение трёх движков есть в гайде про локальный ИИ на LM Studio, Ollama и llama.cpp, а пошаговая установка с нуля разобрана в гайде про нейросеть на компьютере через Ollama.

Промпт-проверка: как за 5 минут понять, годится ли модель

Скачал модель и не понимаешь, хорошая ли она для твоих задач. Прогоняй один и тот же тест на всех кандидатах, разница вылезает сразу.

Ты помощник. Выполни четыре задания подряд, каждое пронумеруй.
 
1. Перепиши это предложение деловым тоном без канцелярита: «Мы тут подумали и решили, что надо бы уже наконец сделать этот отчёт, потому что дедлайн вроде как горит».
 
2. В корзине было 3 ящика по 12 яблок. Из каждого забрали по 4 яблока, потом добавили ещё один полный ящик. Сколько яблок стало? Покажи вычисления.
 
3. Составь список из 5 пунктов: что проверить перед отправкой договора клиенту.
 
4. Переведи на английский: «Отгрузка задерживается на три рабочих дня из-за проблем на складе».
 
Отвечай на русском, кратко, без вступлений.

Что смотреть в ответе. Первое задание показывает качество русского: если после переписывания текст стал корявее, модель русский не держит. Второе показывает арифметику, правильный ответ 36. Третье показывает, умеет ли она в структуру. Четвёртое показывает перевод.

Модель, которая провалила первое и второе задание, для работы на русском не годится, каким бы ни был её рейтинг в англоязычных тестах.

Держи на диске две модели вместо одной: тяжёлую под задачи, где нужно качество, и трёхмиллиардную под мгновенные мелочи вроде перевода строки. Переключение в Ollama это одна команда, а лёгкая модель отвечает в разы быстрее, когда думать не над чем.

Русский язык: какие из восьми держат его лучше

Отдельных официальных замеров русского для этих моделей никто не публикует, поэтому опираться приходится на практику. По типовым задачам вроде переписывания, перевода и деловых писем расклад такой.

Уверенно держат русский: Qwen3.5 9B и Qwen3 8B. Грамматика ровная, падежи на месте, деловой тон получается с первого раза.

Держат сносно: Gemma 3 4B и DeepSeek-R1 8B. Ошибки редкие, но в длинных текстах начинают появляться кальки с английского.

Заметно слабее: Llama 3.1 8B, Llama 3.2 3B и Mistral 7B. Смысл передают, но текст надо вычитывать, особенно окончания и порядок слов.

Отдельная история это Qwen2.5-Coder 7B: код объясняет по-русски нормально, обычные тексты писать не умеет по определению.

Работает ли это из России без VPN и без карты

Да, и в этом главная прелесть темы. Все восемь моделей бесплатны, лежат в открытом доступе и после загрузки считаются на твоём компьютере офлайн.

Каталог ollama.com из России обычно открывается напрямую, и модели качаются без VPN. Капризничает Hugging Face, откуда веса тянет LM Studio: загрузка иногда обрывается на середине. Обходной путь простой, качай через Ollama, а LM Studio уже подключается к скачанным файлам.

Ни карты, ни подписки, ни зарубежного номера телефона не нужно ни на одном шаге. Аккаунт для скачивания моделей тоже не требуется.

Единственные расходы это железо и электричество. Карта на 8 ГБ на август 2026 года стоит примерно от 25 до 45 тысяч рублей в зависимости от модели и того, берёшь ты новую или с рук: RTX 3060 на 12 ГБ на вторичном рынке идёт дешевле новой RTX 4060 на 8 ГБ, и для локальных моделей она объективно интереснее из-за лишних четырёх гигабайт памяти.

Если выбираешь карту специально под локальные нейросети, смотри на объём памяти. Игровые тесты тут вторичны. Старая RTX 3060 на 12 ГБ запустит модель, которую новая RTX 4060 на 8 ГБ не потянет, при том что в играх 4060 быстрее. Для этой задачи гигабайты решают больше, чем частота чипа.

Если карты нет вовсе, модель запустится и на процессоре, просто медленно. Для трёхмиллиардных моделей это терпимо, для восьмимиллиардных обычно нет.

Что пойдёт не так: честные ограничения

Знания устарели. Локальная модель обучена до какой-то даты и не ходит в интернет. Спросишь про курс валюты или новинку прошлой недели, получишь уверенную выдумку.

Разрыв с облаком реален. Модель на 8 миллиардов параметров и модель на сотни миллиардов это разные весовые категории. На сложных задачах локальная будет проигрывать, и с этим надо просто смириться. Свежий пример того, что сейчас умеет большая открытая модель на домашнем железе, разобран в гайде про Muse Glimmer от Meta, но там уже требуется 24 ГБ памяти.

Длинный диалог тормозит. Чем больше история, тем больше KV-кэш и тем медленнее ответы. На восьмигигабайтной карте после сотни сообщений разговор лучше начать заново.

Карта греется. Под нагрузкой видеокарта уходит в потолок и держится там всё время генерации. На ноутбуках это означает шум вентиляторов и сброс частот через несколько минут работы.

Русский требует проверки. Ни одна из моделей этого размера не пишет по-русски идеально. Черновик она даст, вычитывать всё равно тебе.

Проверь, что всё работает

Открой терминал и запусти модель командой из таблицы. Первое сообщение должно прийти в течение пары секунд после загрузки.

Посмотри на скорость появления текста. Если слова идут потоком быстрее, чем ты читаешь, модель влезла в видеокарту. Если появляются по одному с паузами, слои ушли на процессор.

Открой мониторинг видеопамяти во время генерации. Windows: диспетчер задач, вкладка Производительность, раздел графического процессора. Занятая память должна быть ниже потолка карты хотя бы на полгигабайта.

Прогони тестовый промпт из раздела выше и оцени русский. Если результат хуже ожиданий, попробуй модель линейки Qwen того же размера.

Отключи интернет и задай вопрос ещё раз. Ответ должен прийти как обычно, это доказательство, что всё считается локально.

Чек-лист: у тебя всё работает, если

  • Ты знаешь реальный объём видеопамяти своей карты и вычел из него гигабайт на рабочий стол.
  • Скачана модель в квантовании Q4, полный размер на такую карту не влезет.
  • Скорость выдачи выше 15 токенов в секунду, текст идёт потоком.
  • В мониторинге видеопамять не упирается в потолок во время генерации.
  • Тестовый промпт на русском отработал без грубых ошибок в падежах.
  • Модель отвечает при выключенном интернете.
  • На диске лежит вторая, лёгкая модель для мелких задач.
  • Ты понимаешь, какие задачи оставляешь локальной модели, а какие уносишь в облако.

Восемь гигабайт это рабочий минимум. Потолком мечты его не назовёшь, но его хватает на приватность, офлайн и ноль рублей за запросы. Начни с Qwen3.5 9B, а дальше подбирай под задачу.

По материалам MakeUseOf: 8 Local AI Models That Run Great on 8GB of VRAM or Less, с собственной проверкой каталога Ollama и замеров на RTX 3070, август 2026.

Частые вопросы

Какая локальная нейросеть лучшая для 8 ГБ видеопамяти?

На август 2026 это Qwen3.5 9B в четырёхбитном сжатии. На RTX 3070 она занимает 6,96 ГБ видеопамяти при контексте 32 тысячи токенов и выдаёт 54,9 токена в секунду, полностью помещаясь в карту. Это единственная модель класса 9B, которая на 8 ГБ не сбрасывает слои на процессор.

Сколько параметров модели влезет в 8 ГБ видеопамяти?

Модели на 7-9 миллиардов параметров в квантовании Q4 занимают примерно 5-7 ГБ, и это рабочий потолок для карты на 8 ГБ. Модели на 12-14 миллиардов требуют 10-11 ГБ и начинают сбрасывать слои на процессор, после чего скорость падает в разы. Простая прикидка: миллиарды параметров умножь на 0,6 и прибавь 1,5 ГБ на контекст.

Нужен ли VPN, чтобы скачать локальную модель в России?

Для работы модели нет, после загрузки она считается офлайн. Каталог ollama.com из России обычно открывается напрямую, и качать модели можно без VPN. Проблемы бывают с Hugging Face, откуда веса тянет LM Studio, там загрузка иногда обрывается. Готовое решение простое: качай через Ollama, а LM Studio подключай к уже скачанным файлам.

Что будет, если запустить модель, которая не влезает в видеопамять?

Она запустится, но часть слоёв уйдёт считаться на процессор, и скорость обвалится. По замерам на RTX 3070 даже 4 слоя из 63, ушедшие в оперативную память, режут скорость выдачи примерно на 70 процентов. Gemma 3 12B на такой карте выдаёт 4,3 токена в секунду вместо привычных 50, а Phi-4 14B падает до 1,8.

Какие локальные модели лучше всего понимают русский язык?

Из тех, что влезают в 8 ГБ, по русскому сильнее всего линейка Qwen: Qwen3.5 9B и Qwen3 8B держат грамматику и падежи заметно ровнее ровесников. Gemma 3 4B хороша для своего размера, Mistral 7B и Llama 3.1 8B на русском заметно слабее и чаще уходят в кальки с английского. Проверяй на своих текстах, разброс большой.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.