Инструменты · 17 мин · обновлено 28 августа 2026 г.

GLM-5.3 Flash: та самая Ox Alpha - как подключить к Claude Code из России и сколько это в рублях (2026)

26 августа 2026 Z.ai раскрыла, что анонимная Ox Alpha - это GLM-5.3 Flash: 320 млрд параметров, из них активны 18 млрд, вход 0,075 доллара за миллион токенов. Разбираю по шагам, как развернуть Claude Code на эту модель из России, во что это выходит в рублях и где она проигрывает Opus.

17 мин чтения

GLM-5.3 Flash: та самая Ox Alpha - как подключить к Claude Code из России и сколько это в рублях (2026)

GLM-5.3 Flash - это китайская модель под код и агентские задачи, которую Z.ai две недели катала на OpenRouter анонимно под именем Ox Alpha. 26 августа 2026 маску сняли. Внутри MoE-архитектура на 320 миллиардов параметров, из которых на каждый запрос работают 18 миллиардов, контекст до 1 048 576 токенов у основного провайдера и цена входа 0,075 доллара за миллион токенов против 5 долларов у Claude Opus 4.8.

Дальше разбираю по шагам: что вскрылось в цифрах, где модель реально дотягивается до Opus, а где нет, как за пять минут развернуть на неё Claude Code из России, во что это выходит в рублях и почему свои рабочие файлы туда отправлять не стоит. Все цены и характеристики сняты живьём из API OpenRouter и документации Z.ai 28 августа 2026.

Ox Alpha оказалась GLM-5.3 Flash от Z.ai: 320 млрд параметров, 18 млрд активных, нативная мультимодальность и веса под лицензией MIT. По индексу кодинга Artificial Analysis она берёт 71,5 против 74,3 у Claude Opus 4.8, по агентскому индексу обгоняет его (58,2 против 49,4), а стоит в 67 раз дешевле на входе. К Claude Code подключается двумя переменными окружения за пять минут. Главный минус для нас: заплатить российской картой напрямую нельзя, и рабочие секреты в неё лучше не носить.

320млрд

всего параметров в модели, архитектура MoE

18млрд

активных параметров на один запрос, отсюда и дешевизна

0,075$/млн

вход по промо-цене против 5 долларов у Claude Opus 4.8

84,3балла

Terminal-Bench 2.1 по карточке модели на Hugging Face

Коротко: пять слов, без которых дальше непонятно

  • MoE (Mixture of Experts) - модель собрана из множества узких блоков-экспертов, и на каждый запрос включается лишь часть из них. Отсюда 320 миллиардов параметров на диске и 18 миллиардов в работе.
  • Активные параметры - сколько весов реально участвует в вычислении ответа. Именно они определяют, сколько стоит один токен, а не общий размер модели.
  • Flash - у Z.ai это приставка для дешёвой быстрой версии линейки. Есть большая GLM-5.3, есть облегчённая GLM-5.3 Flash.
  • reasoning_effort - переключатель глубины размышления. У Flash три уровня: low, high и max, по умолчанию стоит max.
  • Anthropic-совместимый эндпоинт - адрес чужого API, который говорит на том же протоколе, что и Anthropic. Благодаря ему Claude Code можно развернуть на любую модель, которая такой адрес даёт.

Что вскрылось 26 августа: Ox Alpha - это GLM-5.3 Flash

20 августа на OpenRouter и OpenCode появилась модель без владельца. Провайдер Stealth, цена ноль, контекст миллион с лишним токенов, никаких объяснений, кто её обучил. За несколько дней она вынесла лидерборды и разошлась по всем каналам про ИИ. Мы разбирали её тогда же: что известно про Ox Alpha и почему свой код туда лучше не грузить.

26 августа Z.ai выложила карточку GLM-5.3-Flash на Hugging Face и подтвердила: это была она. В каталоге OpenRouter модель теперь лежит под своим именем z-ai/glm-5.3-flash, каноничный слаг с датой релиза z-ai/glm-5.3-flash-20260826, репозиторий весов zai-org/GLM-5.3-Flash, лицензия MIT.

Версия про Z.ai, которую тогда собрали по отпечаткам API, оказалась верной. Версия про команду MiMo из Xiaomi отпала.

Приём с анонимным превью стал стандартной практикой. Модель выкатывают без имени, собирают чистые отзывы и место в рейтингах без эффекта бренда, а потом снимают маску на пике внимания. Ox Alpha отработала этот сценарий идеально: к моменту анонса про неё уже все знали.

Что за модель по железу: 320 миллиардов, из которых работают 18

Главная цифра тут вторая. Общий размер в 320 миллиардов параметров говорит про объём знаний, а 18 миллиардов активных говорят про то, сколько железа тратится на каждый ваш запрос. Соотношение примерно один к восемнадцати, и именно оно превращается в ценник.

Что заявлено в карточке модели:

  • Гибридное внимание: разреженное плюс линейное. Это то, что позволяет модели не разваливаться на длинном контексте, когда в неё закинут репозиторий целиком.
  • Manifold-Constrained Hyper-Connections (mHC) - собственная разработка Z.ai для связей между слоями.
  • Нативная мультимодальность: первая в линейке GLM-5 модель, которая изначально умеет текст, картинки и видео на входе. На выходе только текст.
  • Обучение и инференс на китайских ИИ-чипах целиком, без ускорителей NVIDIA.
  • Лицензия MIT: веса можно скачать и крутить у себя, если найдётся, на чём. Для 320 миллиардов параметров домашняя видеокарта не подойдёт, но для компании с парком серверов это открытая дверь.

Контекст в каталоге OpenRouter заявлен как 1 310 720 токенов, у основного провайдера доступен 1 048 576, потолок одного ответа 131 072 токена. Больше всего это значит для агентских сценариев: агент может часами ходить по проекту и не терять начало разговора.

Формула: цена токена определяется активными параметрами, а качество ответа общим размером модели. MoE разводит эти две величины, и вот почему Flash при размере уровня флагмана стоит как модель начального уровня.

Сколько это стоит в долларах и рублях

Цены сняты из документации Z.ai и живого API OpenRouter 28 августа 2026, курс ЦБ на этот день 85,95 рубля за доллар.

МодельВход, $/млнВыход, $/млнВход, ₽/млнВыход, ₽/млн
GLM-5.3 Flash (промо)0,0750,256,521,5
GLM-5.3 Flash (после 9 сентября)0,150,5012,943
GLM-5.3 (большая)1,44,4120378
Claude Sonnet 52,010,0172860
Claude Opus 4.85,025,04302149
Claude Opus 55,025,04302149

Скидка 50 процентов на Flash действует до 9 сентября 2026, дальше цена удваивается. Даже удвоенная она остаётся примерно в 33 раза дешевле Opus на входе.

Отдельная строка - чтение кеша: 0,015 доллара за миллион, около 1,3 рубля. В агентской работе, где один и тот же контекст проекта уезжает в модель по сто раз за сессию, эта цифра важнее основной.

Что это значит на практике. Плотный рабочий день с агентом это примерно 15-20 миллионов входных токенов и 1-2 миллиона выходных, если гонять большой проект. На Flash по промо-цене выходит около 130 рублей за день. На Opus те же объёмы стоили бы порядка 8-10 тысяч.

Дешёвая модель не заменит понимания, как вообще устроена работа с агентом. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Честные бенчмарки: где она рядом с Opus, а где нет

Z.ai формулирует аккуратно: модель «подобралась» к Claude Opus 4.8 в кодинге и агентских задачах. Посмотрим, что стоит за этой формулировкой.

Индексы Artificial Analysis, снятые из каталога OpenRouter 28 августа 2026:

МодельИнтеллектКодингАгентский
Claude Opus 563,178,059,2
GLM-5.3 (большая)59,574,859,1
GLM-5.3 Flash57,571,558,2
Claude Opus 4.857,374,349,4
Claude Sonnet 555,371,549,7

Картина получается неровная, и это честнее любой рекламной строчки.

По общему интеллекту Flash идёт вровень с Opus 4.8 и даже на две десятых впереди. По кодингу проигрывает почти три балла и попадает ровно в Claude Sonnet 5. По агентскому индексу обходит Opus 4.8 почти на девять баллов, и вот это самое интересное число во всей таблице.

Агентский индекс Artificial Analysis, август 2026

Claude Opus 5
59,2
GLM-5.3
59,1
GLM-5.3 Flash
58,2
Claude Sonnet 5
49,7
Claude Opus 4.8
49,4

Агентский индекс меряет длинные цепочки: модель должна вызывать инструменты, читать результат, исправляться и не терять цель через двадцать шагов. Раньше именно на этом дешёвые модели сыпались, и Flash тут действительно вышла на уровень флагманов.

Из собственных бенчмарков Z.ai в карточке модели заявлены Terminal-Bench 2.1 на 84,3, Deep-SWE на 63,4 и HLE с инструментами на 55,3. Замеры делались с контекстом до 300 тысяч токенов и генерацией до 163 840.

Все цифры выше опубликованы либо самим разработчиком, либо агрегатором бенчмарков. Своего теста на русских рабочих задачах мы пока не гоняли, и обещать, что модель поведёт себя так же на твоём проекте, было бы враньём. Ниже дам промпт, которым это проверяется за пятнадцать минут.

Чего у Flash нет

  • Уровня Opus 5 в сложной архитектуре и рефакторинге
  • Русского интерфейса и поддержки на русском
  • Оплаты российской картой напрямую
  • Понятной политики хранения запросов на нашем языке

Что реально даёт

  • Агентские цепочки на уровне флагманов
  • Контекст на миллион токенов, весь проект целиком
  • Цену в 67 раз ниже Opus на входе
  • Открытые веса под MIT, можно поднять у себя

Как подключить GLM-5.3 Flash к Claude Code

Claude Code читает адрес сервера из переменной окружения. Подменяешь адрес, и агент остаётся тем же, а отвечать начинает другая модель. Приём тот же, что мы описывали для прошлой версии в гайде GLM в Claude Code, поменялись только имя модели и цена.

Если Claude Code у тебя ещё не стоит, начни с установки Claude Code с нуля, а сюда вернись потом.

Ключ ≈ 5 мин

  • Регистрация на z.ai или openrouter.ai
  • Пополнение баланса зарубежным способом
  • Создание API-ключа в личном кабинете
1

Переменные ≈ 2 мин

  • Три строки в профиль оболочки
  • Перезапуск терминала
2

Проверка ≈ 10 мин

  • Тестовый промпт на своей задаче
  • Сверка расхода в кабинете провайдера
3

Путь 1: напрямую через Z.ai

Этот путь короче и дешевле, потому что посредников нет. Открываешь z.ai, регистрируешься, пополняешь баланс, забираешь ключ в разделе API Keys. Дальше в ~/.zshrc или ~/.bashrc дописываешь три строки:

export ANTHROPIC_BASE_URL="https://api.z.ai/api/anthropic"
export ANTHROPIC_AUTH_TOKEN="твой_ключ_z_ai"
export ANTHROPIC_MODEL="glm-5.3-flash"

Перезапускаешь терминал и запускаешь claude в папке проекта. Внешне ничего не изменится, а под капотом поедет китайская модель.

Путь 2: через OpenRouter

У OpenRouter есть свой Anthropic-совместимый адрес, и Claude Code разворачивается на него точно так же. Разница в том, что OpenRouter сам маршрутизирует запрос между провайдерами и берёт небольшую комиссию сверху, зато один ключ открывает сотни моделей и можно переключаться между ними одной переменной. Если ты с этой площадкой ещё не работал, посмотри разбор как пользоваться OpenRouter.

export ANTHROPIC_BASE_URL="https://openrouter.ai/api/v1"
export ANTHROPIC_AUTH_TOKEN="sk-or-твой_ключ"
export ANTHROPIC_MODEL="z-ai/glm-5.3-flash"

Как понять, что подключилось

Не верь тишине в терминале. Проверяй двумя способами сразу.

Первый: задай модели вопрос, на который Claude и GLM отвечают по-разному. Второй, надёжный: открой личный кабинет провайдера и посмотри, что расход по ключу пошёл. Если баланс не двигается, значит запросы всё ещё летят в Anthropic.

Ты сейчас работаешь как агент в моём проекте. Ответь коротко, без вступлений:
 
1. Как называется модель, которая формирует этот ответ, и какая компания её обучила?
2. Какой у тебя лимит контекста в токенах?
3. Прочитай файлы в текущей папке и назови, на каком языке и фреймворке написан проект.
 
Дальше выполни одну реальную задачу: найди в проекте самый длинный файл, объясни в трёх предложениях, что он делает, и предложи, какой кусок из него стоит вынести отдельно. Ничего не меняй в файлах без моего подтверждения.

Третий пункт и финальная задача важнее первых двух: они показывают, как модель работает с инструментами и реальным кодом, а не то, что она про себя рассказывает.

Не переключай на Flash сразу весь рабочий процесс. Держи два профиля оболочки: в одном переменные прописаны, в другом нет. Тогда сложную архитектурную задачу можно за секунду вернуть на Claude, а рутину и длинные агентские прогоны оставить дешёвой модели.

Как оплатить из России

Ни Z.ai, ни OpenRouter карты российских банков не принимают. Сами эндпоинты при этом из России открываются и региональных блокировок у них нет, так что задача сводится только к оплате.

Рабочие варианты:

  1. Зарубежная карта. Своя или выпущенная в банке дружественной страны. Самый чистый путь, если она у тебя есть.
  2. Попросить друга за границей. Пополнение баланса разовое, привязывать карту навсегда не нужно.
  3. Сервис оплаты подписок. Проводит платёж за тебя и берёт процент. Подойдёт сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент).
  4. Крипта. OpenRouter принимает пополнение в USDC, у Z.ai такого канала нет.

Если у твоего провайдера что-то из этих доменов режется, спасёт любой рабочий VPN, но именно для GLM он обычно не нужен: домены не в реестрах и по региону запросы не отбиваются.

Оплата по токенам работает с предоплаченного баланса, автопродления там нет. Но и предохранителя тоже нет: агент в цикле может сжечь весь баланс за час, если задача зациклилась. Ставь в кабинете провайдера лимит расхода в день сразу, до первого запуска, а не после первого неприятного письма.

Отдельно про подписку. У Z.ai есть GLM Coding Plan с фиксированной месячной платой вместо оплаты по токенам, и Flash в него уже включён. Тарифная сетка и лимиты там меняются чаще, чем выходят статьи, поэтому цену смотри на сайте z.ai в момент покупки. Логика выбора простая: работаешь агентом каждый день - считай подписку, гоняешь наплывами - оплата по токенам выйдет дешевле.

Почему рабочие файлы туда лучше не грузить

Тут придётся сказать прямо, без смягчений.

Когда ты запускаешь Claude Code на чужом эндпоинте, агент получает те же права, что и обычно: он читает файлы проекта, видит содержимое .env, ходит по истории git и отправляет всё это на сервер. Разница только в том, чей это сервер.

В случае Flash сервер принадлежит китайской компании Z.ai. Политика обработки запросов у неё своя, читать её нужно на английском на сайте провайдера, и никаких гарантий уровня корпоративного договора у частного пользователя с предоплаченным балансом на двадцать долларов нет. Через OpenRouter добавляется ещё один посредник, и цепочка становится длиннее.

Что не отправлять:

  • приватные репозитории и код под NDA;
  • файлы .env, ключи, токены доступа, строки подключения к базам;
  • персональные данные клиентов и содержимое договоров;
  • внутреннюю аналитику, выгрузки, финансовые модели.

Что отправлять спокойно: учебные проекты, пет-проекты, открытый код, разбор чужих репозиториев с GitHub, черновые прототипы, где нет ни одного живого ключа.

Технический предохранитель занимает одну минуту. Заведи в корне проекта файл `.claudeignore` и внеси туда `.env`, папку с ключами и каталоги с выгрузками. Агент перестанет их читать независимо от того, на какую модель ты его развернул.

Кому это подходит, а кому нет

Подходит, если ты гоняешь агента много и по рутине: правки по шаблону, багфиксы, тесты, разбор незнакомого репозитория, длинные цепочки с инструментами. Тут разница в качестве почти не чувствуется, а разница в счёте чувствуется очень.

Подходит, если ты только учишься и боишься сжечь деньги на экспериментах. Сто рублей на балансе Flash это несколько дней спокойной практики.

Не подходит, если работаешь с чужими данными или под договором о неразглашении. Тут вопрос закрывается на первом же пункте, и никакая экономия его не перевешивает.

Не подходит, если задачи упираются в архитектуру: спроектировать систему с нуля, вытащить проект из запутанного легаси, разобрать неочевидный баг на стыке трёх сервисов. Три балла разницы в индексе кодинга выглядят мелочью на графике и превращаются в лишний час отладки на практике. Если бюджет позволяет, на такое лучше Claude Opus 5.

Рабочая схема для большинства: Flash на объём, Claude на сложное. Переключение занимает секунду, а счёт за месяц падает в разы.

Что дальше

Промо на Flash кончается 9 сентября 2026, и это первая дата, за которой стоит следить. Вторая: у Z.ai теперь три модели в линейке 5.3 плюс большая GLM-5.3, и историю с анонимными превью они явно продолжат.

Отдельно интересно, что открытые веса под MIT делают со всем этим рынком. Модель уровня прошлогоднего флагмана можно скачать и поднять у себя, и порог для компаний, которым нельзя отправлять код наружу, только что заметно опустился.

Чек-лист: что у тебя теперь есть

  • Понимание, что Ox Alpha была превью GLM-5.3 Flash, и это подтверждено самой Z.ai 26 августа 2026.
  • Реальные характеристики: 320 миллиардов параметров, 18 миллиардов активных, контекст до миллиона токенов, лицензия MIT.
  • Таблица цен в долларах и рублях с датой курса и датой окончания промо.
  • Честная картина по бенчмаркам: агентские задачи на уровне флагманов, кодинг на уровне Sonnet 5, архитектура слабее Opus.
  • Две готовые связки переменных окружения, чтобы развернуть Claude Code на Flash через Z.ai или через OpenRouter.
  • Промпт для проверки, что подключение действительно сработало и модель видит проект.
  • Список того, что в эту модель отправлять нельзя, и способ закрыть вопрос файлом .claudeignore.
  • Понимание, когда переключаться обратно на Claude и почему это нормально.

По материалам выпуска TLDR AI от 27 августа 2026: https://tldr.tech/ai/2026-08-27

Частые вопросы

Ox Alpha и GLM-5.3 Flash - это одна модель?

Да. 26 августа 2026 Z.ai подтвердила, что анонимная модель Ox Alpha, которую с 20 августа бесплатно раздавали на OpenRouter и OpenCode под провайдером Stealth, была превью GLM-5.3 Flash. Сейчас она лежит в каталоге OpenRouter под своим именем z-ai/glm-5.3-flash, а веса выложены на Hugging Face под лицензией MIT.

Сколько стоит GLM-5.3 Flash в рублях?

На 28 августа 2026 действует промо-цена 0,075 доллара за миллион входных токенов и 0,25 за миллион выходных, это около 6,5 и 21,5 рубля по курсу ЦБ 85,95. Скидка 50 процентов кончается 9 сентября 2026, после неё будет примерно 13 и 43 рубля за миллион. Для сравнения, Claude Opus 5 стоит 430 и 2149 рублей за тот же объём.

Как подключить GLM-5.3 Flash к Claude Code?

Прописать две переменные окружения. ANTHROPIC_BASE_URL со значением https://api.z.ai/api/anthropic и ANTHROPIC_AUTH_TOKEN со своим ключом Z.ai, плюс ANTHROPIC_MODEL со значением glm-5.3-flash. Claude Code думает, что говорит с Anthropic, а запросы уходят на китайский эндпоинт. Второй путь - тот же приём через OpenRouter с базовым адресом https://openrouter.ai/api/v1 и моделью z-ai/glm-5.3-flash.

GLM-5.3 Flash работает из России без VPN?

Сами эндпоинты api.z.ai и openrouter.ai из России открываются и блокировок по региону у них нет, отдельного российского запрета на GLM тоже нет. Проблема будет на оплате: карты российских банков ни Z.ai, ни OpenRouter не принимают, нужен зарубежный способ платежа. Если у провайдера что-то режется, поможет любой рабочий VPN.

Можно ли грузить в GLM-5.3 Flash рабочий код?

Приватные репозитории, файлы с ключами, клиентские данные и всё под NDA туда лучше не отправлять. Модель обслуживается на серверах китайской компании Z.ai, политика хранения запросов у неё своя, а через OpenRouter добавляется ещё один посредник. Для учебных проектов, пет-проектов и разбора чужого открытого кода ограничений нет.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.