Инструменты · 16 мин · обновлено 29 июля 2026 г.

Что такое ARC-AGI и почему новый Claude на нём взлетел в 2026: объясняем на пальцах

Claude Opus 5 набрал 30,2% на тесте ARC-AGI-3, почти вчетверо обойдя прежний рекорд GPT-5.6. Разбираем простыми словами, что это за бенчмарк на настоящий интеллект, чем он отличается от школьных тестов моделей и почему цифра важна, но радоваться рано.

16 мин чтения

Что такое ARC-AGI и почему новый Claude на нём взлетел в 2026: объясняем на пальцах

Claude Opus 5 набрал 30,2 процента на тесте ARC-AGI-3 и почти вчетверо обошёл прежний рекорд, который держал GPT-5.6 Sol с 7,8 процента. Это бенчмарк, который специально придумали, чтобы проверять не заученные знания модели, а способность разбираться в новых задачах с нуля. Именно поэтому цифру так активно обсуждают: на большинстве обычных тестов топовые модели давно упёрлись в потолок, а здесь пространства для роста ещё вагон.

Дальше разберём без хайпа три вещи. Что такое ARC-AGI и почему его называют тестом на настоящий интеллект. Как вышло, что новый Claude на нём так рванул, а прошлый Opus набирал всего полтора процента. И стоит ли из этой цифры делать вывод, что до мыслящей машины осталось полшага, или радоваться рано.

ARC-AGI - это набор головоломок от исследователя Франсуа Шолле, который меряет умение решать новые задачи, а не вспоминать заученное. В свежей интерактивной версии ARC-AGI-3 Claude Opus 5 взял 30,2 процента (проверено ARC Prize 24 июля 2026), обойдя GPT-5.6 Sol с его 7,8 и модели класса Fable с их 20. Прошлый Opus 4.8 брал около 1,5, так что скачок огромный. Но у человека на первой версии теста около 85 процентов, а независимая перепроверка показала, что на похожих играх Opus 5 идёт вровень с конкурентами. Прогресс реальный, до людей ещё далеко.

Коротко: термины из статьи одной строкой

  • Бенчмарк - стандартный тест, на котором гоняют все модели, чтобы сравнивать их по одной линейке.
  • ARC-AGI - бенчмарк на абстрактное мышление: угадай правило по паре примеров. Расшифровка - Abstraction and Reasoning Corpus.
  • Обобщение - способность применить понятое правило к новой ситуации, которой не было в примерах. То, что легко людям и тяжело нейросетям.
  • Агентность - умение не просто ответить, а действовать по шагам: пробовать, смотреть на результат, менять план.
  • AGI - гипотетический универсальный ИИ, который осваивает новые навыки не хуже человека. ARC-AGI меряет один из кусочков этого свойства, а не весь.

Что такое ARC-AGI и зачем его придумали

Большинство тестов для нейросетей похожи на школьный экзамен: набор вопросов, у каждого есть правильный ответ, модель отвечает, считаем процент. Проблема в том, что модель обучалась на половине интернета. Многие такие вопросы и ответы она по сути видела. Получается проверка памяти, а не сообразительности.

Франсуа Шолле, инженер и автор библиотеки Keras, ещё в 2019 году в работе «On the Measure of Intelligence» предложил другой подход. Он сказал: интеллект - это не сколько ты знаешь, а как быстро ты осваиваешь новое. И собрал набор задач, которые устроены так, что вызубрить их нельзя.

Выглядит одна задача просто. Тебе показывают две-три пары картинок: слева вход, справа выход. На картинках цветные клетки на сетке. Твоя работа - понять, по какому правилу вход превращается в выход, и применить это правило к новой картинке, для которой ответ не показан.

Например, на всех примерах синий квадрат превращается в красный, а всё остальное остаётся как было. Правило очевидно человеку за секунду. Или сложнее: фигура отражается по диагонали, дырки закрашиваются, маленькие объекты копируются в углы. Каждая задача - своё уникальное правило, и таких правил в тесте сотни.

Само название расшифровывается как Abstraction and Reasoning Corpus for Artificial General Intelligence - корпус задач на абстракцию и рассуждение. Слово corpus тут значит просто большой набор примеров, как корпус текстов в лингвистике.

Фокус в том, что для человека эти головоломки почти тривиальны. По оценкам создателей, люди решают около 85 процентов задач первой версии, и каждую хотя бы один человек из двух проходит. А вот нейросети годами буксовали на уровне 20-30 процентов, хотя щёлкали университетские экзамены и олимпиадную математику. Разрыв ровно там, где Шолле его и предсказывал: заучить ответ нельзя, надо соображать на месте.

Почему это называют тестом на настоящий интеллект

Ключевое слово - новизна. Каждая задача в ARC-AGI сконструирована так, чтобы её нельзя было встретить в обучающих данных. Правило, которое надо вывести, ты видишь впервые. Значит, модель не может подсмотреть ответ в памяти, ей приходится строить логику здесь и сейчас.

Именно это Шолле считает главным признаком интеллекта. Не эрудицию, а эффективность освоения нового. Настоящий универсальный ИИ по его определению - это система, которая осваивает навыки и решает задачи, под которые её не проектировали и не тренировали. ARC-AGI меряет как раз это свойство в чистом виде, без примеси зубрёжки.

Суть: обычные тесты проверяют, что модель знает. ARC-AGI проверяет, способна ли она разобраться в том, чего не знает. Первое давно решено, второе - открытая проблема, и потому каждый процент здесь на вес золота.

Есть и практический смысл. Если модель умеет выводить новые правила из пары примеров, она и в работе будет меньше ошибаться на нестандартных задачах: незнакомый формат таблицы, новый чужой код, необычный запрос клиента. То, за что мы ценим сильного junior-специалиста: не всё знает, но быстро въезжает. Подробнее про то, где Claude ведёт себя как толковый инженер, мы разбирали в гайде Claude как старший инженер.

Чем ARC-AGI-3 отличается от прошлых версий

За шесть лет тест прошёл три поколения, и они устроены по-разному. Это важно, потому что рекорд Opus 5 поставлен именно на третьей, самой свежей и самой злой версии.

ВерсияГодФорматЧто проверяетБалл человека
ARC-AGI-12019Статичные головоломки на сеткеВывод правила по примерамоколо 85%
ARC-AGI-22025Те же сетки, но сложнее и хитрееБолее глубокая абстракцияпанель людей проходит
ARC-AGI-32026Интерактивные игровые средыЛогика плюс планирование действийлегко даётся людям

Первые две версии - это загадки, которые ты решаешь, глядя на статичную картинку. Показали примеры, ты угадал правило, вписал ответ. Умственная работа, но одноходовая.

ARC-AGI-3 устроен принципиально иначе. Модель попадает внутрь маленькой игры, правила которой заранее никто не объявляет. Надо самому понять, что тут можно делать, к чему приводят действия, какая цель, и довести партию до конца шаг за шагом. Пробуешь, смотришь на реакцию среды, корректируешь план. Это уже не про чистую логику, а про логику плюс агентность: способность действовать в неизвестности.

Представь, что тебя посадили за незнакомую видеоигру без инструкции и без подписей на кнопках. Ты жмёшь, смотришь, что происходит, и за минуту-другую соображаешь правила. Человеку это привычно с детства, а для нейросети каждая такая среда - вызов. Вот это и меряет ARC-AGI-3.

Поэтому третья версия жёстче ловит слабые места. На статичной головоломке модель может взять перебором вариантов. В интерактивной среде перебор дорог: каждое действие меняет мир, назад не отмотаешь, надо реально понимать, что делаешь. Как это связано с агентными навыками моделей вообще, мы показывали в разборе ИИ-агенты простыми словами.

Почему новый Claude на нём взлетел

Теперь к цифрам, ради которых всё затевалось. Вот как разложился результат на ARC-AGI-3 по моделям.

30,2%

Claude Opus 5, новый рекорд теста

~20%

модели класса Fable

7,8%

GPT-5.6 Sol, прежний рекорд

~1,5%

прошлый Claude Opus 4.8

Разрыв огромный. Opus 5 обошёл прежнего рекордсмена GPT-5.6 Sol почти вчетверо и оторвался от собственного предшественника Opus 4.8 примерно в двадцать раз. Результат в 30,2 процента независимо проверила команда ARC Prize и подтвердила 24 июля 2026, а не просто озвучила сама Anthropic. Это важно: на модных бенчмарках разработчики любят показывать удобные для себя цифры, а тут проверка сторонняя.

На старых версиях теста Opus 5 тоже забрался высоко: 97,5 процента на ARC-AGI-1 и 90,4 на ARC-AGI-2. То есть статичные головоломки для него почти решённая история, и самое интересное происходит именно на интерактивной третьей.

По ходу тестов Opus 5 решил пять сред, которые до него не покорялись ни одной модели, причём четыре из них на уровне человека или выше. Всего из 25 публичных демо-сред теперь пройдены шесть.

Но самое любопытное - не сам балл, а как модель его брала. Исследователи заметили поведение, которого раньше у топовых моделей не видели: Opus 5 сам переводил игровую задачу в алгебраическую запись и впервые самостоятельно выводил уравнения отражения, чтобы описать, как устроена среда. Проще говоря, модель не тыкалась вслепую, а строила математическую гипотезу о правилах игры и проверяла её. Это ровно тот тип поведения, ради проверки которого тест и делали.

Модель сама формулировала гипотезы о том, как устроена среда, а не просто перебирала действия.

- по материалам ARC Prize, руководитель проекта Грег Камрадт

Откуда взялся такой скачок именно у Claude, коротко: Anthropic давно вкладывается в агентные сценарии, где модель работает по шагам с инструментами, и ARC-AGI-3 как раз про это. Если хочешь понять, что нового в самой модели помимо этого теста, у нас есть отдельный разбор Claude Opus 5: цена и оплата из России.

Хочешь не читать про способности Claude, а самому загонять его в работу? Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Почему радоваться рано: честная сторона цифры

Тридцать процентов звучат как прорыв, и это правда прорыв относительно прошлых моделей. Но давай трезво посмотрим, что эта цифра НЕ значит.

О чём балл не говорит

  • Что Claude мыслит как человек: на первой версии теста люди берут 85%, тут пока 30
  • Что модель одинаково сильна на любых играх такого типа
  • Что до универсального ИИ остались считанные шаги
  • Что рекорд удержится: бенчмарки перебивают за недели

О чём говорит честно

  • Что новый Claude заметно лучше предшественников выводит правила незнакомых сред
  • Что он строит гипотезы, а не тыкается перебором
  • Что разрыв с конкурентами на этом тесте сейчас большой и проверен сторонней командой
  • Что направление верное: рост есть там, где остальные тесты давно уперлись в потолок

Отдельно стоит независимая перепроверка. Сторонние исследователи прогнали Opus 5 на своём наборе игр Witness, сделанном в том же духе, что ARC-AGI-3, но не входящем в официальный тест. И там картина скромнее: Opus 5 набрал около 43 баллов и статистически идёт вровень с моделями kimi-k3 и Fable-5, обгоняя прошлый Opus 4.8, но без поколенческого отрыва.

Вывод из этого простой: часть скачка на официальном тесте может быть заточкой под конкретные среды, а не универсальным ростом соображалки. Это не обвинение в жульничестве, а обычный эффект: когда под бенчмарк оптимизируют, результат на нём растёт быстрее, чем реальная способность. Поэтому один рекорд на одном тесте - повод присмотреться, а не делать выводов про интеллект вообще.

Президент ARC Prize Грег Камрадт при этом отметил, что скромный результат на стороннем наборе не перечёркивает возможного роста рассуждений у модели. Истина, как обычно, посередине: прогресс настоящий, но это одна ступенька, а не финиш. Полезная привычка тут - смотреть не на одну громкую цифру, а на серию тестов и на то, кто их проверял. Как вообще не тонуть в потоке ИИ-новостей и отличать сигнал от шума, мы собрали в гайде как держать пульс новостей ИИ.

Как самому проверить модель на новизну

Гонять полноценный ARC-AGI дома не нужно, но сам принцип легко повторить в любом чате с Claude или другой сильной моделью. Дай ей мини-головоломку на вывод правила и посмотри, объяснит ли она логику, а не просто выдаст ответ. Вот готовый промпт, который создаёт такую задачу и заставляет модель рассуждать вслух.

Ты решаешь головоломку в стиле ARC на вывод правила.
 
Даны пары вход-выход, где каждая клетка обозначена буквой цвета:
Пример 1: вход [С,С,П / П,П,П] -> выход [К,К,П / П,П,П]
Пример 2: вход [П,С,П / С,П,С] -> выход [П,К,П / К,П,К]
 
Задача: вход [С,П,С / П,С,П] -> выход ?
 
Сначала сформулируй правило одним предложением.
Потом покажи ход рассуждения по шагам.
В конце дай итоговую сетку выхода.
Не угадывай: если правило неоднозначно, скажи об этом.

Сильная модель тут заметит, что каждый синий (С) становится красным (К), а остальное не меняется, и честно проговорит это правило. Слабая либо ошибётся, либо выдаст ответ без объяснения. Так ты своими глазами увидишь разницу между «вспомнила» и «сообразила». Если хочешь научиться писать такие задания и вообще внятные запросы, загляни в базовый гайд как писать промпты.

Приём работает как быстрый тест новой модели. Придумай пару собственных правил, которых точно нет в интернете, и прогони через модель. Если она объясняет логику и признаёт неоднозначность - хороший знак. Если уверенно врёт - будь осторожнее с ней в работе.

Как потрогать Claude Opus 5 из России

Раз уж речь про модель, которая ставит рекорды, логично спросить: как её запустить из России. Сама по себе новость про ARC-AGI платить не заставляет, но если захочешь пощупать Opus 5 руками, вот расклад по шагам.

Шаг 1 ≈ 5 мин

  • Включаешь VPN с зарубежным адресом: Anthropic блокирует российские IP
  • Без него сайт Claude просто не откроется
1

Шаг 2 ≈ 10 мин

  • Регистрируешь аккаунт: нужна почта, иногда иностранный номер для смс
  • Opus 5 доступен и в бесплатном режиме с лимитами, и в подписке Pro за 20 долларов в месяц
2

Шаг 3 ≈ 10 мин

  • Оплата: либо российский агрегатор за рубли, либо сервис-посредник платит зарубежной картой за тебя
  • Российские карты Anthropic напрямую не принимает
3

По деньгам два реалистичных пути. Первый - зайти через российский агрегатор нейросетей вроде BotHub или MashaGPT: там модели Claude доступны за рубли с любой карты и часто вообще без VPN, потому что запрос идёт через их сервер. Второй - оформить полноценную подписку Claude Pro, а оплату провести через сервис оплаты подписок, который спишет деньги зарубежной картой, а ты переведёшь ему рубли (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Если с VPN пока не разбирался, для доступа к сайту Claude подойдёт любой рабочий VPN с адресом в Европе или США.

Не пытайся платить российской картой напрямую на сайте Anthropic: платёж не пройдёт, а лишние попытки иногда приводят к блокировке аккаунта. Сразу иди через агрегатор или посредника. Гарантий не даст никто: правила сервисов меняются, и способ, рабочий сегодня, может отвалиться через месяц.

Пошагово с ценами в рублях, скринами и разбором подводных камней всё расписано в отдельных гайдах: как оплатить Claude из России и общий как пользоваться Claude в России в 2026. А если выбираешь между Claude и конкурентом, поможет сравнение Claude против ChatGPT.

Что забрать из статьи

  • ARC-AGI меряет соображалку, а не память. Это набор головоломок, где надо вывести новое правило по паре примеров, а вызубрить ответ нельзя.
  • ARC-AGI-3 - интерактивная и самая сложная версия. Модель попадает в игру без инструкции и должна сама понять правила через действия.
  • Claude Opus 5 поставил рекорд: 30,2 процента. Это почти вчетверо больше прежнего лидера GPT-5.6 Sol и примерно в двадцать раз больше прошлого Opus 4.8.
  • Скачок реальный и проверен сторонней командой ARC Prize. Модель строила математические гипотезы о правилах, а не перебирала действия наугад.
  • Но радоваться рано. У человека на первой версии теста 85 процентов, а на независимом наборе игр Opus 5 идёт вровень с конкурентами. Это прогресс, а не приход мыслящей машины.
  • Проверять модели на новизну можно самому. Дай ей свежую головоломку на вывод правила и смотри, объясняет ли она логику или просто угадывает.

Главный вывод не про то, кто выиграл этот раунд. Рекорды на ARC-AGI перебивают месяцами, и через полгода лидером может стать другая модель. Важнее сам факт: появился тест, на котором ещё есть куда расти, и модели наконец начали на нём двигаться осмысленно. За этой линией и стоит следить, а не за одной громкой цифрой в заголовке.

По материалам the-decoder: Anthropic’s Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence.

Частые вопросы

Что такое ARC-AGI простыми словами?

Это тест на способность решать новые задачи, которых модель не видела в обучении. Придумал его исследователь Франсуа Шолле в 2019 году. Вместо вопросов на знание фактов там даются мини-головоломки: по паре примеров надо угадать правило и применить его. Человек справляется легко, а нейросетям это долго не давалось.

Сколько Claude Opus 5 набрал на ARC-AGI-3?

30,2 процента, и это проверенный ARC Prize результат от 24 июля 2026. Прежний рекорд держал GPT-5.6 Sol с 7,8 процента, то есть Opus 5 обошёл его почти вчетверо. Модели уровня Fable брали около 20 процентов, а прошлый Opus 4.8 всего около 1,5.

Чем ARC-AGI-3 отличается от ARC-AGI-1 и 2?

Первые две версии - это статичные головоломки на сетках: показали примеры, угадай правило. ARC-AGI-3 интерактивный: модель попадает в игровую среду, где правила заранее не объявлены, и должна сама их нащупать через действия, спланировать шаги и довести партию до конца. Это проверка не только логики, но и агентности.

Значит ли высокий балл, что Claude уже мыслит как человек?

Нет. Балл вырос сильно, но 30 процентов на ARC-AGI-3 против 85 у человека на ARC-AGI-1 показывают, что до людей далеко. Независимый тест Witness показал, что на других играх того же типа Opus 5 идёт вровень с конкурентами. Цифра важная, но это прогресс, а не финиш.

Как потрогать Claude Opus 5 из России?

Сама модель доступна в подписке Claude Pro за 20 долларов в месяц, но Anthropic блокирует российские IP, поэтому нужен VPN. Платить проще через российский агрегатор нейросетей за рубли или через сервис-посредник, который оплатит подписку зарубежной картой за тебя.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.