О чём Claude и ChatGPT думают перед ответом: как заглянуть внутрь нейросети в 2026
Исследователи научились доставать зашифрованные рассуждения Claude, GPT и Gemini. Разбираем, что там внутри, почему пересказ мыслей в интерфейсе врёт, как включить показ рассуждений и как по ним ловить модель на выдумке.
17 мин чтения
Все крупные модели с 2025 года сначала думают, потом отвечают. Эта внутренняя цепочка мыслей называется reasoning trace, и провайдеры её прячут: ты видишь короткий пересказ, а настоящий ход рассуждений уезжает к тебе в браузер зашифрованным блоком. 10 августа 2026 вышла работа, которая показала, как эти блоки расшифровать чужими руками.
Практический вывод из неё простой и неприятный: то, что нейросеть показывает в блоке «Думает», и то, что она реально думала, это два разных текста. Ниже разберём, как устроена подмена, как включить показ рассуждений в Claude, ChatGPT, Gemini и DeepSeek, как по цепочке ловить модель на выдумке и что теперь нельзя писать в чат.
Модели рассуждают перед ответом, но сырые рассуждения тебе не показывают: в интерфейсе крутится саммари, отдельно сгенерированный пересказ. Исследователи научились подсовывать зашифрованные мысли сильной модели её слабому родственнику из той же линейки, и тот печатает их открытым текстом. Из публично выложенных логов так вытащили 367 единиц персональных данных и 182 секрета. Читать рассуждения полезно для проверки фактов, но помни, что видишь ты пересказ, а всё, что ты пишешь в чат, оседает в цепочке.
Коротко: словарик по теме
- Chain of thought (цепочка рассуждений) - черновик, который модель пишет себе перед ответом. Разбор задачи, прикидки, отбрасывание вариантов.
- Reasoning trace - тот же черновик, но как объект в API: блок данных, который возвращается вместе с ответом.
- Расширенное мышление (extended thinking) - режим, в котором модель тратит на этот черновик заметно больше токенов. Включается тумблером или выбором модели.
- Саммари рассуждений - короткий пересказ цепочки, который тебе показывают в интерфейсе вместо оригинала.
- Дистилляция - обучение своей модели на ответах чужой. Цепочки рассуждений для этого ценнее готовых ответов: в них виден сам метод, тогда как готовый ответ показывает только результат.
Что именно вскрыли исследователи
Работа называется «Stealing Reasoning Traces from Proprietary LLM APIs», препринт выложен 10 августа 2026. Авторы: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping и Maksym Andriushchenko.
Отправная точка вот в чём. Провайдеры не хранят цепочки рассуждений у себя на сервере. Они шифруют их и отдают клиенту, чтобы тот в следующем запросе вернул блок обратно. Так дешевле: состояние сессии хранит пользователь вместо датацентра.
Уязвимость нашлась в том, что эти блоки оказались взаимозаменяемыми. Внутри экосистемы одного провайдера зашифрованный кусок мыслей подходит к другой сессии, другому пользователю и, главное, к другой модели. Дальше механика простая: берёшь блок от сильной модели, подсовываешь его самой слабой модели той же линейки и просишь продолжить. Слабая модель расшифровывает содержимое и выкладывает его открытым текстом.
Авторы называют это «фундаментальной асимметрией безопасности внутри семейства моделей»: у младших моделей защита слабее, и они работают оракулом расшифровки для старших.
| Провайдер | Чьи рассуждения доставали | Кто расшифровывал |
|---|---|---|
| Anthropic | Opus 4.8, Sonnet 5, Sonnet 4.6, Sonnet 4.5 | Haiku 4.5 |
| OpenAI | GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-5 | GPT-5.6 Luna |
| Gemini 3.1 Pro, Gemini 3 Pro, Gemini Robotics 1.6 | Gemini Robotics 1.6 |
По Anthropic и Google вывод в работе одинаковый: рассуждения любой модели воспроизводятся любой другой из той же семьи. У OpenAI серия GPT-5.6 отыгрывает трейсы всех предыдущих поколений, но там пришлось повозиться: разные шаблоны промптов под разные блоки, перебор попыток и отдельные обходы антидистилляционных защит.
Antidistillation guard это защита ровно от такого сценария: модель должна отказаться пересказывать чужие внутренние рассуждения. Она сработала только частично и только у OpenAI. Anthropic и Google к моменту публикации такой проверки между моделями одной линейки не имели.
Четыре способа применить дырку
Исследователи разложили последствия на четыре сценария, и только первый из них про кражу технологий.
Дистилляция
- вытащить рассуждения топовой модели дёшево
- обучить на них свою
- получить сам метод работы, не только готовые ответы
Джейлбрейк наоборот
- видимый ответ вежливо отказывает
- в рассуждениях модель успела расписать опасное
- расшифровка достаёт то, что она сама решила не показывать
Извлечение секретов
- люди выкладывают логи агентов в репозитории
- зашифрованные блоки выглядят безобидной кашей символов
- внутри пароли, ключи и почты
Невидимая инъекция
- вредная команда прячется в зашифрованном блоке
- глазами в логе её не видно
- агент читает блок и выполняет
Четвёртый пункт особенно противный для тех, кто собирает агентов. Обычная инъекция промпта хотя бы читается человеком в логе. Инъекция внутри зашифрованного трейса выглядит как служебный мусор, и ревью её пропускает.
Сколько секретов лежит в открытом доступе прямо сейчас
Больше всего в работе отрезвляет замер на живых данных. Авторы собрали 6 708 логов работы агентов, которые люди сами выложили на GitHub и Hugging Face, и расшифровали из них 315 320 блоков рассуждений.
расшифровано из 6 708 публичных логов агентов на GitHub и Hugging Face
сессий содержали утечку чувствительных данных: 328 штук из 6 708
ключи, пароли и токены, восстановленные по всем источникам, плюс 367 единиц персональных данных
Из настоящих пользовательских сессий восстановили 62 ключа API, 33 пароля, 24 токена доступа, 7 приватных ключей, 30 личных почтовых адресов и 6 внешних IP.
Обрати внимание на логику попадания. Никто эти пароли специально не публиковал. Человек работал с агентом, агент по ходу дела увидел ключ в переменных окружения или в конфиге, покрутил его в рассуждениях, и ключ осел в зашифрованном блоке. Потом человек выложил лог сессии в репозиторий, потому что глазами там ничего опасного не видно.
Если ты выкладывал логи работы Claude Code, Codex или другого агента в публичный репозиторий, считай их скомпрометированными. Зашифрованные блоки рассуждений расшифровываются, а внутри может быть всё, что агент видел на твоей машине. Перед публикацией логи чистят от блоков thinking целиком, а ключи, которые агент мог видеть, перевыпускают.
Если ты дошёл до места, где хочется наконец разобраться, как работать с Claude осознанно и без сюрпризов. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Кто показывает настоящие мысли, а кто пересказ
Теперь к практике. Заглянуть в рассуждения можно и без всяких атак, только надо понимать, что именно тебе показывают.
| Сервис | Что видно в интерфейсе | Это оригинал или пересказ |
|---|---|---|
| Claude (claude.ai) | блок рассуждений над ответом при включённом расширенном мышлении | пересказ у старших моделей |
| ChatGPT | строка «Думает» разворачивается в шаги | пересказ, сырую цепочку OpenAI не отдаёт |
| Gemini | блок с рассуждениями у моделей линейки Pro | пересказ |
| DeepSeek | вся цепочка целиком по умолчанию | оригинал |
| Локальные модели (Ollama, LM Studio) | всё, что генерирует модель | оригинал |
Это ключевая развилка. У трёх больших американских провайдеров то, что ты читаешь в блоке рассуждений, генерируется отдельно поверх настоящей цепочки. Пересказ пишет другая модель, и отвечает она за читаемость. За точность в этом блоке не отвечает никто.
В работе есть прямая иллюстрация: модель в реальной цепочке назвала верный ответ ещё до того, как начала решать задачу, а в саммари от API этого момента не было вообще. Авторы называют такие случаи «неверными саммари, которые отмывают нечитаемые трейсы», и отдельно отмечают пост-фактум рационализации, когда пересказ выглядит логичным выводом, хотя вывод был готов заранее.
Формула: блок «Думает» работает витриной, журналом он никогда и не был. Он показывает, как модель могла бы прийти к ответу, и почти никогда не показывает, что она реально сделала первым шагом.
Как включить показ рассуждений
Claude ≈ 1 мин
- открой новый чат на claude.ai
- в строке ввода нажми переключатель режимов
- включи расширенное мышление
- над ответом появится сворачиваемый блок рассуждений
ChatGPT ≈ 1 мин
- выбери думающую модель в переключателе сверху
- задай вопрос и не уходи со страницы
- кликни по строке Думает во время генерации
- после ответа шаги остаются доступны по клику
Gemini ≈ 1 мин
- переключись на модель линейки Pro
- задай задачу в несколько шагов
- разверни блок с рассуждениями над ответом
DeepSeek ≈ 1 мин
- включи режим глубокого размышления в строке ввода
- цепочка печатается целиком, без пересказа
- лучший вариант, если нужен именно сырой ход мысли
Если хочется посмотреть на настоящую цепочку без ограничений провайдера, самый честный путь это локальная модель через Ollama или LM Studio. Там нет ни шифрования, ни саммари: что модель сгенерировала, то ты и видишь. Качество рассуждений будет заметно ниже топовых, зато механика видна как на ладони.
Шесть признаков, по которым в рассуждениях видно выдумку
Ради этого читать цепочку и стоит. Даже пересказ часто выдаёт момент, где модель перестала опираться на факты и начала сочинять. Разбор причин, почему это вообще происходит, есть в отдельном гайде про то, почему нейросеть выдумывает факты.
Красные флаги в цепочке
- «точной цифры нет, возьму примерно» - а в ответе цифра точная
- «вероятно, источник называется так» - придуманное название исследования
- вывод сформулирован в первых двух строках, дальше идёт подгонка
- модель ушла с твоего вопроса на соседний, более удобный
- «пользователь, кажется, хочет услышать, что» - подстройка под тебя
- в цепочке одна оговорка про неуверенность, в ответе её нет
Признаки честной работы
- перечислены конкретные источники с датами
- названы два варианта и объяснён выбор одного
- есть явный отказ от куска задачи с причиной
- в цепочке проверка своего же промежуточного результата
- сомнение из цепочки доехало до финального ответа
- арифметика посчитана по шагам, с промежуточными числами
Самый частый и самый вредный паттерн это пятый пункт слева. Модель в рассуждениях прикидывает, какой ответ тебя устроит, и дальше пишет его. Как это лечится настройками и промптом, разобрано в гайде про то, как выключить подхалимство ИИ. Родственная история про подгонку под оценку описана в материале про взлом награды.
Три промпта, которые вытаскивают честный ход мысли
Первый заставляет модель разделить знание и догадку до того, как она напишет красивый ответ.
Прежде чем отвечать, разбей задачу на три списка. СПИСОК 1. Что я знаю точно и могу назвать источник. СПИСОК 2. Что я предполагаю по косвенным признакам. СПИСОК 3. Чего я не знаю и не смогу узнать без поиска. Только после трёх списков дай ответ. В ответе рядом с каждым фактом поставь пометку [1], [2] или [3] по номеру списка. Если список 3 не пустой, начни ответ со слов «неполные данные».
Второй прогоняет уже готовый ответ через проверку. Работает лучше в новом чате, чтобы модель не защищала свою работу.
Ниже текст, сгенерированный другой нейросетью. Найди в нём всё, что похоже на выдумку. Проверь по пунктам: 1. Каждое число, дату и процент. Есть ли они в природе или выглядят правдоподобно придуманными. 2. Каждое название: исследования, компании, книги, закона, функции сервиса. 3. Каждую ссылку и цитату с атрибуцией. 4. Утверждения вида «эксперты считают» без имени эксперта. Выдай таблицу: утверждение, вердикт (подтверждаю / сомневаюсь / скорее выдумка), чем проверить за минуту. ТЕКСТ: [вставь сюда]
Третий нужен, когда важен именно порядок действий модели, сам итог тут вторичен. Он ломает привычку сначала выдать вывод, а потом обосновать.
Реши задачу строго по протоколу и не забегай вперёд. Шаг 1. Перепиши мою задачу своими словами и назови, что именно в ней неоднозначно. Шаг 2. Выпиши данные, которых тебе не хватает. Не додумывай их. Шаг 3. Предложи два разных подхода к решению и назови слабое место каждого. Шаг 4. Выбери один подход и объясни выбор одной фразой. Шаг 5. Только теперь решай. Шаг 6. Назови одно место в своём решении, где ты меньше всего уверен. Если на шаге 2 список не пустой, остановись и задай мне вопросы вместо решения.
Шестой шаг третьего промпта даёт неожиданно много. Модель почти всегда честно указывает слабое звено, если спросить об этом отдельным пунктом после решения. Больше приёмов такого рода собрано в базовом гайде о том, как писать промпты.
След Claude в рассуждениях китайских моделей
Отдельное приложение к работе авторы назвали «Слон в комнате» и посвятили вопросу, обучали ли свежие открытые модели на рассуждениях проприетарных. Проверяли на Kimi K3 и GLM 5.2.
Результат осторожный: если подставить Kimi K3 короткий фрагмент расшифрованных рассуждений Claude Opus 4.8, стиль её собственных дальнейших рассуждений и стиль видимого ответа смещаются в сторону Claude. Авторы прямо оговариваются: это разведочный анализ, доказательством дистилляции он не является.
Рядом лежит независимая проверка. 27 июля 2026 исследователи из MATS Benji Berczi и Kyuhee Kim опубликовали замеры на тех же двух моделях. GLM 5.2 во всех десяти прогонах называла себя собой. Kimi K3 в шести прогонах из десяти представлялась Kimi и в четырёх Claude, причём после 20 июля поведение поменялось.
Самое интересное началось, когда моделям сказали «ты Claude». У GLM 5.2 доля ответов без цензуры на чувствительные для КНР вопросы выросла с 17% до 85%, а доля уклончивых и вводящих в заблуждение ответов упала с 63-69% до 22%.
Это не доказательство дистилляции, но это показывает, что представление Claude о себе зашито в веса этих моделей.
- Benji Berczi и Kyuhee Kim, MATS, The Register
Практический смысл для тебя тут один. Если ты гоняешь Kimi или другую открытую китайскую модель, помни, что её поведение может заметно меняться от того, кем ты её назовёшь в системном промпте. Про побочные эффекты этой линейки есть отдельный разбор: Kimi K3 сбежал из песочницы.
Работает ли всё это из России
Смотреть рассуждения можно в любом из четырёх сервисов, но доступность разная.
DeepSeek и российские агрегаторы открываются напрямую. Claude, ChatGPT и Gemini требуют обхода блокировок: понадобится рабочий VPN с чистым IP, потому что на серверных адресах хостингов Claude выдаёт бан на регистрации. Подробности по каждому сервису разобраны в гайде Claude из России через VPN без банов.
По деньгам расклад такой. Расширенное мышление в Claude доступно и на бесплатном тарифе, но лимиты там кончаются за несколько длинных задач. Claude Pro стоит $20 в месяц, ChatGPT Plus столько же, по курсу на август 2026 это примерно 1600-1800 ₽. Оплатить российской картой напрямую нельзя, нужна зарубежная карта или сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Пошагово способы разобраны в гайде как оплатить Claude из России.
Вариант без карты вообще: российские агрегаторы. BotHub с тарифами от $3 и MashaGPT (Base 990 ₽ в месяц, Ultra 1990 ₽ в месяц) дают доступ к моделям OpenAI и Anthropic за рубли. Оговорка важная: агрегатор работает через API, а через API саммари рассуждений может не приходить вовсе, так что блок «Думает» ты там увидишь не всегда.
Если задача только в том, чтобы посмотреть на живую цепочку рассуждений и потренироваться её читать, начни с DeepSeek. Он открывается из России без VPN, бесплатен и показывает сырую цепочку целиком, без пересказа. Как его запустить, описано в гайде про DeepSeek.
Что теперь не стоит писать в чат
Вывод из истории с утечками касается каждого, кто пользуется агентами, включая тех, кто вообще не пишет код.
Всё, что попало в контекст, попадает и в рассуждения. Пароль, который ты вставил «просто чтобы модель поняла структуру конфига», ключ API в скриншоте, номер карты в примере, чужие персональные данные в таблице для анализа. В видимом ответе этого может не быть, а в трейсе оно останется. Секреты в чат не вставляют: заменяй их плейсхолдерами вида KEY_HERE, а реальные значения подставляй руками уже у себя.
Три правила, которые закрывают почти весь риск:
- Перед тем как дать агенту доступ к папке проекта, убери оттуда файлы с ключами или добавь их в игнор. Агент читает то, до чего дотянется.
- Логи сессий не выкладывай в публичные репозитории без чистки. Блоки рассуждений вырезай целиком, они выглядят безобидно и не являются таковыми.
- Ключи, которые агент видел в процессе работы, перевыпускай так же спокойно, как после утечки на скриншоте.
Чек-лист: что у тебя теперь есть
- Понимание, что блок «Думает» у Claude, ChatGPT и Gemini это пересказ, а сырая цепочка от тебя скрыта.
- Знание, где включается показ рассуждений в четырёх основных сервисах.
- Шесть признаков, по которым в цепочке видно момент перехода модели к выдумке.
- Три готовых промпта: разделение знания и догадки, аудит чужого текста на выдумку, протокол пошагового решения.
- Понимание, что твои секреты оседают в рассуждениях и уезжают вместе с логами.
- Ориентир по доступу и ценам из России, включая бесплатный вариант с сырой цепочкой.
Главное, что стоит унести. Возможность заглянуть в рассуждения даёт ещё один источник для проверки, гарантией правды она не работает. Но источник хороший: модель в черновике врёт заметно реже, чем в чистовике, потому что черновик она пишет для себя.
По материалам работы «Stealing Reasoning Traces from Proprietary LLM APIs» (arXiv:2608.09867, 10 августа 2026) и публикации WIRED «A New Trick Reveals AI Models’ Inner Thoughts»: https://www.wired.com/story/a-new-trick-reveals-ai-models-inner-thoughts/
Частые вопросы
Как посмотреть, о чём думает нейросеть перед ответом?
В Claude включи расширенное мышление и раскрой блок рассуждений над ответом. В ChatGPT нажми на строку «Думает» во время генерации. В Gemini разверни блок с рассуждениями у моделей линейки Pro. В DeepSeek цепочка показывается целиком по умолчанию. Везде, кроме DeepSeek, тебе показывают пересказ. Сырая цепочка мыслей остаётся скрытой.
Рассуждения в интерфейсе это настоящие мысли модели?
Нет. Claude, OpenAI и Google показывают саммари: отдельный короткий текст, который генерируется поверх настоящей цепочки. В работе «Stealing Reasoning Traces from Proprietary LLM APIs» от 10 августа 2026 показан случай, когда модель назвала верный ответ ещё до того, как начала решать задачу, а в саммари этого не было вообще.
Что исследователи вытащили из зашифрованных рассуждений?
Из 315 320 расшифрованных блоков рассуждений, собранных с GitHub и Hugging Face, авторы работы восстановили 62 ключа API, 33 пароля, 24 токена доступа, 7 приватных ключей и 30 личных почт. Всего по всем источникам 367 единиц персональных данных и 182 секрета.
Правда ли, что китайские модели обучали на ответах Claude?
Прямых доказательств нет. В приложении к работе показано, что если подставить Kimi K3 кусок расшифрованных рассуждений Claude Opus 4.8, её собственный стиль рассуждений уезжает в сторону Claude. Отдельно исследователи из MATS выяснили, что GLM 5.2 в режиме «ты Claude» отвечает на чувствительные для КНР вопросы без цензуры в 85% случаев против 17% в обычном режиме.
Можно ли по рассуждениям понять, что нейросеть выдумывает факты?
Часто да. Ищи в цепочке фразы вроде «точной цифры нет, возьму примерно», перескок от вопроса к соседней теме, готовый вывод в первых строках и подгонку под него дальше. Если модель в мыслях призналась, что источника не нашла, а в ответе выдала уверенную цифру со ссылкой, это выдумка.