Инструменты · 27 мин · обновлено 11 августа 2026 г.

Muse Glimmer от Meta: как бесплатно запустить нейросеть на своём компьютере в 2026

Meta выложила Muse Glimmer - открытую модель на 30 миллиардов параметров, которая работает прямо на домашнем компьютере. Разбираем реальные требования к памяти, установку через Ollama и LM Studio, скорость на разных машинах и работает ли это из России без VPN и подписки.

27 мин чтения

Muse Glimmer от Meta: как бесплатно запустить нейросеть на своём компьютере в 2026

Meta выложила 10 августа 2026 года модель Muse Glimmer на 30 миллиардов параметров, и главное в ней то, что она рассчитана на запуск дома. Всё считается на твоём компьютере: скачал веса один раз и дальше работаешь офлайн, без облака и без подписки. Лицензия Apache 2.0, то есть пользоваться можно свободно, в том числе для заработка.

Вопрос ровно один: потянет ли железо. Meta честно говорит про 24-32 ГБ памяти, и это отсекает обычный ноутбук с 16 ГБ. Ниже разберём реальные требования, установку через Ollama и LM Studio, скорость в словах в секунду на конкретных машинах, честные результаты бенчмарков и то, как это работает из России.

Muse Glimmer - открытая модель Meta на 30 миллиардов параметров, заточенная под локальных ИИ-агентов. Ставится одной командой `ollama run muse-glimmer`, весит около 18 ГБ в скачивании и требует 24 ГБ памяти минимум, комфортно 32 ГБ. Работает офлайн, без VPN, без карты и без подписки, данные никуда не уходят. Контекст 131 072 токена, поддержка 100+ языков, лицензия Apache 2.0.

Словарик: что значат слова из этой статьи

  • Открытые веса (open-weight) - файл с «мозгами» модели выложен в свободный доступ, его можно скачать и запустить у себя. Именно этим Muse Glimmer отличается от ChatGPT и Claude, которые живут только на чужих серверах.
  • Квантизация - сжатие модели, при котором числа внутри неё хранятся грубее. Модель худеет в 3 раза и почти не глупеет. Без этого Muse Glimmer требовала бы 58 ГБ памяти вместо 17.
  • Токен - кусочек текста, примерно половина слова для русского языка. Скорость модели меряют в токенах в секунду.
  • Контекст - сколько текста модель держит в голове за один раз. У Muse Glimmer это 131 072 токена, примерно 300 страниц.
  • Агент - режим, в котором нейросеть выполняет задачу сама: ищет файлы, вызывает программы, исправляется после ошибки. Muse Glimmer обучали именно под это.
  • DFlash - маленькая модель-помощник, которая идёт в комплекте и ускоряет ответы. Про неё отдельный раздел ниже.

Коротко: что важно знать про Muse Glimmer

  • Дата выхода: 10 августа 2026. Разработчик: Meta Superintelligence Labs.
  • Размер: 30 миллиардов параметров, из них около 29,6 миллиарда - языковая часть и 1,8 миллиарда - зрительный кодировщик для картинок.
  • Лицензия Apache 2.0: бери, меняй, зарабатывай, ссылку на автора оставь.
  • Память: от 24 ГБ, рекомендуется 32 ГБ. На 16 ГБ не поедет.
  • Куда ставить: Ollama, LM Studio, llama.cpp, MLX, ExecuTorch.
  • Знания модели обрезаны 4 января 2026 года.

Что такое Muse Glimmer и зачем Meta её выложила

Meta делала эту модель со скромной задачей: обогнать ChatGPT она даже не пытается. Компания взяла свою закрытую модель Muse Spark, обучила на её ответах модель поменьше и вычистила из неё всё, что мешает работать на домашнем железе.

Внутри - плотный трансформер на 52 слоя со скрытой размерностью 6656 и словарём на 202 048 токенов. Внимание чередуется по схеме «три локальных слоя, один глобальный», это и позволяет держать 131 072 токена контекста без взрывного роста аппетита к памяти. К языковой части приделан зрительный кодировщик ViT-G/14 на 1,8 миллиарда параметров, поэтому модель умеет смотреть на картинки и скриншоты.

Обучение шло в три захода. Сначала предобучение на выходах Muse Spark, потом промежуточная стадия на «агентских» данных, где модель училась вызывать инструменты и разгребать последствия своих ошибок, и в конце дообучение под конкретные сценарии. Отсюда набор навыков: доведение задачи до конца, многошаговые рассуждения, восстановление после неудачного вызова инструмента, работа с картинками.

Зачем это Meta, довольно прямо сформулировал Марк Цукерберг.

Вместо того чтобы централизовать суперинтеллект, нам стоит распределить его широко и дать каждому человеку возможность им управлять.

- Марк Цукерберг, Engadget

Apache 2.0 - это редкость для больших моделей. Прошлые релизы Meta шли под своей лицензией с ограничениями по числу пользователей. Здесь ограничений на коммерческое использование нет вообще, что важно, если ты собираешься встраивать модель в свой продукт.

Потянет ли мой компьютер Muse Glimmer

Сначала цифра, которая отрезвляет. В полной точности модель на 30 миллиардов параметров съедает больше 55 ГБ памяти. Такого нет ни в одном домашнем компьютере. Квантизация ужимает её до 17-20 ГБ, и вот с этого момента разговор становится предметным.

К весам добавляется рабочая память: контекст, зрительный кодировщик и модель-ускоритель DFlash. Meta называет два целевых сценария.

СценарийПамятьЧто это на практике
Минимум24 ГБВариант K-Quant-17GB, короткий контекст, работает
Рекомендуемый32 ГБВариант K-Quant-Dynamic, длинный контекст, картинки, DFlash
Дообучение58 ГБ+Полная точность BF16, это уже про рабочую станцию

Meta тестировала модель на трёх машинах: MacBook с чипом M4 Max, MacBook с M5 Max и десктоп с видеокартой RTX 5090. На Маках работает единая память, поэтому 32 или 64 ГБ оперативки закрывают вопрос сразу. На Windows и Linux считается видеопамять: RTX 5090 с её 32 ГБ подходит идеально, RTX-карты на 24 ГБ проходят по нижней границе.

Если у тебя ноутбук с 16 ГБ памяти, Muse Glimmer в нормальном виде не запустится. Существуют версии с более грубым сжатием на 12-15 ГБ, но качество там просядет заметно, и это уже другой разговор. Честнее взять модель поменьше: как выбрать, разобрано в гайде про локальный ИИ и три движка.

Сколько весит Muse Glimmer в разных вариантах

Одна и та же модель существует в нескольких степенях сжатия. Чем грубее сжатие, тем меньше файл и тем сильнее плывёт качество на сложных задачах. Вот таблица требований по памяти от команды Unsloth, которая собрала все варианты.

Сколько памяти требует Muse Glimmer, ГБ

2 бита
13
3 бита
15
4 бита
17
6 бит
21
8 бит
34
BF16
58

Рабочий выбор для дома - четыре бита. Это тот самый вариант на 17 ГБ, который Meta считает основным и на котором мерила скорость. Шесть бит имеет смысл, если у тебя 32 ГБ и хочется выжать точность. Всё, что ниже четырёх бит, берут от безысходности.

Насколько модель тупеет от сжатия, Meta посчитала сама и цифры опубликовала. Это редкость: обычно производитель ограничивается словами «качество почти не меняется».

СборкаПотеря качестваПод какое железо
Полная точность BF16нет64 ГБ видеопамяти
K-Quant-Dynamic0,2%32 ГБ
K-Quant-17GB1,0%24 ГБ

Читается это так. Если у тебя 32 ГБ, ты берёшь официальную сборку K-Quant-Dynamic и теряешь две десятых процента среднего результата, то есть не теряешь ничего заметного. Если 24 ГБ, разница вырастает до процента, и это всё ещё немного. Обе цифры относятся к официальным сборкам Meta. Сторонние агрессивные варианты на два и три бита, которые лежат в открытых репозиториях, никто так не мерил, и там просадка будет совсем другой.

В каталоге Ollama модель лежит тремя тегами: обычный muse-glimmer весом 18 ГБ, он же muse-glimmer:30b, и отдельная сборка muse-glimmer:30b-mlx на 21 ГБ под чипы Apple. Контекст во всех трёх - 128 тысяч токенов. В LM Studio модель называется meta/muse-glimmer и весит 25,77 ГБ, там сборка потяжелее и требование к памяти строже: не меньше 26 ГБ.

Локальная модель - это половина дела, вторая половина в том, как ты с ней разговариваешь. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Как запустить Muse Glimmer через Ollama

Самый короткий путь. Если Ollama у тебя ещё не стоит, поставь по пошаговой инструкции для Windows, Mac и Linux, это минут пятнадцать. Дальше всё сводится к одной команде.

Проверь память ≈ 1 мин

  • На Mac: меню Apple, «Об этом Mac», строка «Память»
  • На Windows: диспетчер задач, вкладка «Производительность»
  • Нужно от 24 ГБ, лучше 32 ГБ
1

Освободи место на диске ≈ 2 мин

  • Скачивание займёт 18 ГБ
  • Плюс запас, модели любят место
2

Запусти команду ≈ 20 мин

  • Открой терминал
  • Введи ollama run muse-glimmer
  • Дождись загрузки, она идёт один раз
3

Напиши первый запрос ≈ 1 мин

  • Курсор в терминале ждёт текст
  • Пиши по-русски, модель поймёт
4

Команда для обычного запуска:

ollama run muse-glimmer

Если у тебя Mac на чипах Apple, бери сборку MLX, она заметно быстрее на этом железе:

ollama run muse-glimmer:30b-mlx

Отдельно интересен режим, в котором Muse Glimmer подставляется вместо облачной модели в агентские программы. Ollama умеет запускать её под привычными оболочками:

ollama launch claude --model muse-glimmer
ollama launch openclaw --model muse-glimmer

То есть привычный интерфейс агента остаётся, а мозги под ним крутятся локально и бесплатно. Если слово «агент» пока звучит абстрактно, начни с гайда про ИИ-агентов простыми словами.

На старте поддержка была только через движок MLX для чипов Apple, версии под NVIDIA и AMD подъезжали следом. Если команда ругается на неподдерживаемое железо, обнови Ollama до последней версии и попробуй снова: каталог обновляется чуть ли не ежедневно.

Как запустить Muse Glimmer через LM Studio без терминала

Если терминал вызывает отторжение, ставь LM Studio. Это обычное приложение с окном, как у ChatGPT: список моделей, кнопка «Скачать», поле для сообщения.

Порядок такой. Скачиваешь LM Studio с официального сайта и устанавливаешь как любую программу. Открываешь вкладку поиска моделей, вводишь muse-glimmer, находишь карточку meta/muse-glimmer. Жмёшь загрузку, ждёшь 25,77 ГБ. Потом переходишь в чат, выбираешь модель в верхнем выпадающем списке и пишешь.

Для тех, кому всё же удобнее командой, у LM Studio есть свой инструмент:

lms get meta/muse-glimmer

LM Studio требует минимум 26 ГБ оперативной памяти под эту модель и честно об этом предупреждает. Программа не даст загрузить модель, которая заведомо не влезет, так что неактивная кнопка загрузки означает нехватку памяти, с установкой при этом всё в порядке.

Скорость: сколько слов в секунду выдаёт модель

Здесь начинается самое интересное. Вместе с моделью Meta выложила DFlash - маленькую вспомогательную модель, которая предлагает блоки по 16 токенов вперёд, а основная модель проверяет их разом. Результат получается точно такой же, как без ускорителя, просто приходит быстрее.

Замеры Meta на четырёхбитной версии, при генерации по одному запросу за раз:

233,4ток/сек

RTX 5090 с DFlash, против 74,9 без него, ускорение в 3,1 раза

50,2ток/сек

MacBook M5 Max с DFlash, против 26,6 без него, ускорение в 1,8 раза

37,8ток/сек

MacBook M4 Max с DFlash, против 23,7 без него, ускорение в 1,5 раза

Переведём в человеческие единицы. Для русского языка один токен - это примерно полслова. Значит на M4 Max ты получаешь около 19 слов в секунду, на M5 Max около 25, на RTX 5090 больше сотни. Даже нижняя граница читается быстрее, чем человек успевает глазами.

Замеры Meta делала в разных движках: Маки мерили через ExecuTorch, видеокарту через llama.cpp. У тебя в Ollama или LM Studio цифры будут отличаться, обычно в меньшую сторону. Считай эти значения верхней планкой, до которой ещё надо дотянуться.

Для сравнения, в дата-центре на ускорителях NVIDIA Blackwell Ultra эта же модель выдаёт больше 20 тысяч токенов в секунду на одну карту. Разрыв с домашним железом стократный, и это ровно та плата за приватность, которую платит локальный ИИ.

Почему 131 тысяча токенов контекста не съедает всю память

Обычная история с локальными моделями: веса влезли, ты радуешься, потом закидываешь длинный документ и получаешь нехватку памяти. Виноваты тут редко сами веса. Память съедает KV-кэш, то есть всё, что модель запомнила про уже прочитанный текст. У Muse Glimmer этот кэш ужат двумя приёмами сразу, и знать про них полезно, потому что от них зависит, сможешь ли ты реально пользоваться заявленным контекстом на 24 ГБ.

Первый приём: 32 головы внимания задают вопросы, а хранят ответы всего 2. Это называется grouped-query attention, и на практике означает, что KV-кэш весит в 16 раз меньше, чем если бы каждая голова тащила свою копию.

Второй приём: слои чередуются по схеме «три локальных, один глобальный» с окном в 2048 токенов у локальных. В 52 слоях модели это 39 локальных и 13 глобальных. Полный контекст на 131 072 токена держат только эти 13, остальные 39 смотрят назад максимум на 2048 токенов. Позиционное кодирование RoPE с параметром 500 000 навешено тоже только на локальные слои.

Что это даёт на практике: длинный контекст у Muse Glimmer почти бесплатный по памяти. Если модель у тебя запустилась, документ на 200 страниц её не уронит.

Тем же способом сделан бесплатным и ускоритель. DFlash - это модель-черновик всего на 5 слоёв с тем же окном в 2048 токенов, 32 головами запросов и 8 головами хранения. Пять слоёв против 52 у основной модели: в память она добавляет считанные сотни мегабайт, а генерацию разгоняет в те самые 1,5-3,1 раза из таблицы выше.

Отсюда практический вывод для тех, у кого ровно 24 ГБ. Экономить на контексте смысла мало, ужимать надо сами веса. Ставь четырёхбитную сборку и спокойно работай с длинными документами, вместо того чтобы брать вариант потяжелее и потом резать контекст до 8 тысяч токенов.

Уровни рассуждения: low, medium, high и xhigh

Мелочь, которую легко пропустить, а она сильно меняет качество. Muse Glimmer умеет думать с разной глубиной, и уровень задаётся прямо в системном промпте. Всего их четыре: low, medium, high и xhigh.

Meta рекомендует high или xhigh для сложных задач: программирования, многошаговых рассуждений и агентской работы. Низкие уровни оставляют для быстрых ответов, где думать особо не над чем. Разница в скорости заметная, потому что на высоких уровнях модель тратит токены на внутренние рассуждения до того, как выдаст ответ.

Системный промпт для агентского режима выглядит примерно так:

Reasoning: xhigh
 
Ты локальный ассистент на компьютере пользователя. Работай по шагам, до конца задачи.
Правила:
1. Сначала опиши план в 2-3 пунктах, потом выполняй.
2. Перед любым действием с файлами скажи, что именно собираешься сделать.
3. Если инструмент вернул ошибку, не сдавайся: разбери причину и попробуй другой путь.
4. В конце дай короткий отчёт, что получилось и что осталось.
Отвечай по-русски.

Насколько Muse Glimmer умная на самом деле

Meta сравнивает модель ровно с двумя конкурентами того же размера: Gemma4-31B от Google и Qwen3.6-27B от Alibaba. Вот показательные цифры из карточки модели.

ТестMuse Glimmer 30BGemma4-31BQwen3.6-27B
MCP Atlas (работа с инструментами)75,554,262,5
DeepSearch QA (поиск и сбор фактов)74,661,771,1
AA-LCR (длинный контекст)80,068,373,3
SWE-Bench Pro (сложный код)51,236,950,2
SWE-Bench Verified (код)76,066,677,2
AIME 2026 (математика)94,789,294,1
GPQA Diamond (наука)83,585,784,2

Ещё два числа из карточки модели стоит держать в голове, потому что они про повседневную работу. Gaia2, тест на длинные задачи с инструментами и проверкой результата, у Muse Glimmer 43,3 из 100. IFBench, тест на точное следование инструкциям, 77,0. Первое число говорит, что больше половины сложных многошаговых поручений модель до конца не дотягивает. Второе означает, что примерно каждую четвёртую инструкцию в промпте она выполнит по-своему, так что формат ответа лучше проверять глазами.

Картина честная: Muse Glimmer обходит обе модели в 12 тестах из набора, при этом Gemma4 остаётся впереди в четырёх, а Qwen3.6 в восьми. Сильнее всего отрыв там, где надо вызывать инструменты и доводить задачу до конца, то есть ровно в том, подо что модель и затачивали.

А теперь трезвая часть. В независимом рейтинге открытых моделей Artificial Analysis на момент выхода Muse Glimmer в режиме high стояла на 18 месте. Впереди Kimi K3 от Moonshot AI, GLM-5.2 от Z.ai и DeepSeek V4 Flash. Для контекста: Qwen3.6-27B там на 17 месте, то есть чуть выше, а Gemma4-31B на 32.

Где Muse Glimmer проигрывает: мышь, клавиатура и терминал

Общая фраза «в восьми тестах впереди Qwen» ничего не говорит про твои задачи. Полезнее посмотреть, в каких именно тестах модель отстаёт, потому что провалы у неё сгруппированы по смыслу, и это прямо влияет на то, что ей стоит поручать.

ТестMuse Glimmer 30BGemma4-31BQwen3.6-27B
OSWorld-Verified (управление компьютером)65,958,575,6
TerminalBench 2.1 (работа в терминале)51,743,460,7
SkillsBench (работа со скиллами)44,332,446,6
OmniDocBench v1.5 (разбор документов)75,872,577,8
τ3-Banking (многошаговые операции)23,515,116,7

Провалы ложатся в одну линию: Muse Glimmer сильна там, где надо думать и дёргать инструменты через MCP, и слабее там, где надо возить мышью по экрану и жить в командной строке. Разрыв в терминале особенно чувствительный: 51,7 против 60,7 у Qwen означает, что каждая пятая консольная задача, которую конкурент вытягивает, у Muse Glimmer развалится.

Отдельно стоит посмотреть на строку τ3-Banking. Здесь Muse Glimmer формально лидирует, только присмотрись к абсолютным числам: 23,5 из 100. Все три модели проваливают этот тест, просто одна проваливает чуть менее катастрофично. Так что многошаговые операции с деньгами локальному агенту не отдают вообще, независимо от того, кто там на первом месте.

Практический вывод: подключай Muse Glimmer через MCP-инструменты. Сценарий «пусть сам покликает мышкой» работает заметно хуже, и разница между этими двумя подходами больше, чем разница между самой моделью и конкурентами. Как устроены MCP-инструменты, разобрано в гайде про MCP простыми словами.

Насколько безопасно давать такому агенту доступ к файлам

Вопрос, который обычно всплывает уже после установки. Локальная модель звучит как «самый безопасный вариант», потому что данные никуда не уходят. С приватностью так и есть, а вот с устойчивостью к атакам всё сложнее, и Meta честно опубликовала цифры.

Первый замер - Siren AgentDojo. Тест проверяет, можно ли подсунуть агенту скрытую команду внутри документа или письма и заставить его сделать что-то не то. У Muse Glimmer доля успешных атак 28,4% при полезности 94,2. То есть модель отлично делает свою работу и при этом ведётся почти на каждую третью подставу.

Доля успешных атак через скрытые команды, меньше - лучше

Gemma4-31B
25,6
Muse Glimmer
28,4
Qwen3.6-27B
40,3

Muse Glimmer посередине: заметно крепче Qwen и чуть слабее Gemma4. Хорошей эту цифру не назовёшь ни у кого, и это общая беда всех сегодняшних агентов. Как именно работают такие атаки, разобрано в гайде про скрытые команды и prompt injection.

Второй замер интереснее и почти не попал в новости. Тест CI Memories проверяет, не выболтает ли модель личные данные из своей памяти там, где не надо. У Muse Glimmer 26,4% нарушений при охвате 64,8. У Gemma4 нарушений вдвое меньше, 12,1, но и охват хуже, 53,0. У Qwen нарушений 53,4, то есть она сливает лишнее в половине случаев.

Смысл в том, что «локально» защищает от утечки наружу, на сервер вендора, и совершенно не защищает от того, что модель сама сболтнёт лишнее внутри своего же ответа. Если агент разгребает твою почту и одновременно пишет ответ клиенту, содержимое личных писем может уехать в этот ответ.

Не давай локальному агенту одновременно доступ на чтение чувствительных файлов и право отправлять что-то наружу: письма, сообщения, коммиты. Каждая третья попытка внедрить скрытую команду проходит успешно, и цифру эту опубликовала сама Meta. Разделяй сессии: разбор документов отдельно, отправка отдельно. Что ещё умеет пойти не так с автономными агентами, собрано в разборе про безопасность автономных ИИ-агентов.

По классификации рисков Meta модель не дотягивает до определения Frontier AI в её собственной рамке Advanced AI Scaling Framework. Риски по химии и биологии, кибербезопасности и потере контроля оценены как умеренные или ниже. Именно поэтому веса вообще разрешили выложить открыто.

Чего у Muse Glimmer нет

  • Первого места среди открытых моделей
  • Уровня ChatGPT или Claude последних версий
  • Работы на ноутбуке с 16 ГБ памяти
  • Понимания видео: ролик она разбирает как набор отдельных кадров
  • Официальных замеров качества русского языка
  • Устойчивости к скрытым командам: 28,4% атак проходят
  • Силы в управлении компьютером и терминале

Что она реально даёт

  • Работу офлайн на одной домашней машине
  • Лицензию Apache 2.0 без ограничений на заработок
  • Контекст 131 072 токена, около 300 страниц
  • Понимание картинок и скриншотов
  • Ускоритель DFlash в комплекте
  • Полную приватность: данные не уходят с компьютера

Формула: Muse Glimmer выигрывает доступностью. Это лучшая модель из тех, что целиком помещаются в один домашний компьютер и не просят за это денег.

Работает ли Muse Glimmer из России без VPN и без карты

Работает, и это её главный практический плюс для рунета. Разберём по пунктам, потому что вопрос задают чаще всего.

Сама модель работает офлайн. После того как веса скачаны, интернет не нужен вообще. Можно выдернуть кабель, отключить Wi-Fi и продолжать работать. Блокировки, замедления и региональные ограничения к локальной модели отношения не имеют.

Карта не нужна ни на каком этапе. Ни при скачивании, ни при использовании. Лицензия Apache 2.0 не требует ни регистрации, ни согласия на условия сервиса, ни привязки платёжного средства. Для сравнения, подписка ChatGPT Plus или Claude Pro стоит 20 долларов в месяц, это около 1650 ₽ по курсу ЦБ на 11 августа 2026 года. Две подписки - примерно 3300 ₽ ежемесячно, и это навсегда, пока пользуешься.

Данные остаются у тебя. Ни один запрос не уходит на сервер Meta. Для рабочих документов, клиентских данных и внутренних материалов это принципиальная разница с облачными сервисами. Подробнее логика приватного рабочего места разобрана в гайде про свой ИИ-воркспейс на компьютере.

Скачивание - единственное место, где может понадобиться VPN. Каталог Ollama из России обычно открывается напрямую, и команда ollama run muse-glimmer отрабатывает без плясок. А вот Hugging Face, откуда веса тянут LM Studio и llama.cpp, ведёт себя по-разному у разных провайдеров: у кого-то летает, у кого-то отваливается на середине. Если это твой случай, VPN нужен ровно на время загрузки, дальше его можно выключить и забыть. Какие сервисы вообще открываются из России без обходных путей, собрано в отдельном разборе про нейросети без VPN.

Качай веса с запасом по времени и по месту на диске. Восемнадцать гигабайт на среднем домашнем интернете - это от двадцати минут до часа. Обрыв на 90% означает повторную загрузку, поэтому лучше запускать в фоне и не трогать компьютер.

Что реально поручить локальному агенту

Модель заточена под агентские сценарии, и это меняет список задач по сравнению с обычным чатом. Вот то, что имеет смысл давать Muse Glimmer.

  • Разбор папки с документами. Пройтись по десяткам файлов, вытащить нужное, свести в таблицу. Облаку такое отдавать страшно, локальной модели можно.
  • Черновая работа с кодом. Результат 51,2 на SWE-Bench Pro означает, что модель вытягивает примерно половину реальных задач из репозиториев. Для рутины этого хватает.
  • Чтение скриншотов. Зрительный кодировщик на месте, так что можно кинуть картинку интерфейса и спросить, что там написано и куда жать. На одну картинку модель тратит до 4096 зрительных токенов, этого хватает на полноэкранный скриншот с мелким текстом. А вот десяток картинок в одном сообщении съест контекст быстрее, чем кажется.
  • Длинная переписка и длинные документы. Контекст на 131 072 токена держит примерно 300 страниц за раз.
  • Фоновые задачи, которые крутятся постоянно. Meta прямо называет сценарий always-on: агент живёт на машине и работает по мере поступления задач, без счётчика токенов и без лимитов.

Что отдавать не стоит, теперь с опорой на конкретные замеры:

  • Свежие факты. Знания модели обрезаны 4 января 2026 года.
  • Управление компьютером кликами. OSWorld-Verified 65,9 против 75,6 у Qwen: если сценарий строится на том, что агент сам возит мышью по чужому интерфейсу, бери другую модель.
  • Долгую жизнь в терминале. TerminalBench 2.1 51,7, это слабое место.
  • Всё, что связано с деньгами и многошаговыми операциями. τ3-Banking 23,5 из 100 у лидера этой тройки говорит сам за себя.
  • Задачи, где агент одновременно читает личное и пишет наружу. Причина в цифрах по безопасности выше.

Разбор того, как вообще делить работу между собой и агентом, есть в гайде какие задачи отдать ИИ-агенту.

Что пойдёт не так: честные ограничения

Meta сама перечисляет ограничения в карточке модели, и их полезно знать заранее.

Модель может выдавать неточные, предвзятые и просто неприятные ответы. Это общее свойство всех языковых моделей, и локальная версия не исключение, скорее наоборот: у неё нет облачных фильтров сверху.

Квантизованные версии иногда отличаются по качеству от полной на пограничных задачах. То есть странное поведение на сложном вопросе может объясняться степенью сжатия. Прежде чем ругать модель, попробуй вариант потяжелее.

Видео модель не понимает как видео. Она разбирает его на отдельные кадры и смотрит на каждый по отдельности, поэтому движение и последовательность событий от неё ускользают.

Официально модель не предназначена для пользователей младше 18 лет.

Отдельный риск - перегрев и разряд батареи. Модель на 30 миллиардов параметров грузит железо всерьёз, ноутбук на автономной работе будет садиться в разы быстрее обычного и шуметь вентиляторами. Для долгих фоновых задач держи машину в розетке.

Проверь, что всё работает

Три быстрые проверки после установки.

Первая: задай вопрос на русском и посмотри на скорость. Если текст ползёт медленнее пяти слов в секунду, значит модель частично считается на процессоре вместо видеокарты, и стоит взять вариант со сжатием потяжелее.

Вторая: отключи интернет и задай вопрос снова. Ответ должен прийти как ни в чём не бывало. Это доказательство, что ты работаешь локально.

Третья: кинь в чат скриншот и попроси описать, что на нём. Если модель отвечает по делу, зрительная часть подключилась корректно.

Чек-лист: у тебя работает Muse Glimmer, если

  • Ты проверил объём памяти и там от 24 ГБ.
  • Модель скачалась целиком и запускается командой или из окна LM Studio.
  • Ответы идут быстрее пяти слов в секунду.
  • При отключённом интернете всё продолжает работать.
  • Модель понимает русский и отвечает на нём без просьб.
  • Ты выставил уровень рассуждения под задачу: high или xhigh для сложного, low для быстрых ответов.
  • Ты понимаешь, что знания модели заканчиваются 4 января 2026 года, и не спрашиваешь у неё свежие новости.
  • Агент не имеет одновременного доступа к личным файлам и к отправке сообщений наружу.

Локальная модель такого уровня год назад была фантастикой: чтобы получить сопоставимое качество, приходилось платить подписку и отдавать свои данные на чужой сервер. Сейчас достаточно компьютера с 32 ГБ памяти и одной команды в терминале. Если железо не тянет, это временно: требования падают каждый год.

Обновлено 11 августа 2026: добавили официальные цифры Meta по потере качества от сжатия, тесты, в которых модель проигрывает Qwen3.6, замеры безопасности Siren AgentDojo и CI Memories, разбор того, почему контекст на 131 тысячу токенов почти не ест память, и результаты Gaia2 и IFBench.

По материалам Lifehacker, MarkTechPost, Meta AI Research и карточки модели на Hugging Face.

Частые вопросы

Сколько памяти нужно для Muse Glimmer?

Комфортный минимум - 24 ГБ памяти под четырёхбитную версию, рекомендуемый вариант - 32 ГБ. Сами веса в сжатом виде занимают около 17-18 ГБ, остальное уходит на контекст и работу с картинками. На ноутбуке с 16 ГБ оперативной памяти полноценно запустить модель не выйдет.

Нужен ли VPN, чтобы пользоваться Muse Glimmer в России?

Для работы модели нет. После загрузки Muse Glimmer считается на твоём компьютере офлайн, интернет ей вообще не нужен. Сеть требуется один раз, чтобы скачать веса. Каталог Ollama из России обычно открывается напрямую, а Hugging Face местами капризничает, и тогда VPN нужен только на время скачивания.

Muse Glimmer бесплатная?

Да, полностью. Модель выложена под лицензией Apache 2.0, это разрешает свободное использование, включая коммерческое, и дообучение под свои задачи. Ни подписки, ни карты, ни лимитов на количество запросов. Платишь только за электричество и за железо, которое у тебя уже есть.

Muse Glimmer умнее ChatGPT?

Нет, и Meta этого не обещает. В открытом рейтинге Artificial Analysis на 10 августа 2026 Muse Glimmer в режиме high занимает 18 место среди открытых моделей, впереди Kimi K3, GLM-5.2 и DeepSeek V4 Flash. Её сила в другом: она реально влезает в один домашний компьютер и работает офлайн.

Понимает ли Muse Glimmer русский язык?

Да, модель обучена на данных более чем 100 языков, русский среди них. Отдельных замеров качества русского Meta не публиковала, поэтому проверяй на своих задачах. По опыту с моделями этого размера русский держится нормально в диалоге и заметно хуже в редких терминах и именах.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.