Контент · 14 мин · обновлено 20 августа 2026 г.

Как ChatGPT выбирает источники: что он реально открывает и как попасть в его ответы (2026)

Исследование 1200 ответов ChatGPT вскрыло его механику поиска: свой индекс labrador вместо Bing, общий кеш страниц и всего 759 реально открытых страниц из 26 900. Разбираем, что доходит до модели с твоей страницы, что теряется по дороге и какие правки реально поднимают шанс на цитату.

14 мин чтения

ChatGPT добирается до твоего сайта тремя разными путями, и до текста статьи доходит куда меньше страниц, чем принято думать. В исследовании RESONEO по 1200 ответам и 26 900 страницам за июль 2026 модель реально открыла и прочитала 759 страниц. Всё остальное она видела кусочком примерно в 200 символов.

Из этого следует неприятная вещь: в большинстве ответов твою страницу оценивают по заголовку и первому абзацу. До полного текста дело чаще всего не доходит. Ниже разберём, как устроены три слоя поиска ChatGPT, по каким цифрам он решает, кого процитировать, что именно теряется по дороге с твоей страницы и какие правки реально двигают шансы.

У ChatGPT три слоя доступа к вебу: собственный индекс labrador, скупленная живьём выдача Google через сервисы bright и oxylabs, и живое открытие страницы юзер-агентом ChatGPT-User. Открытие страницы стоит дорого, поэтому в быстром режиме 93% ответов обходятся вообще без него. Открытая страница становится источником цитаты в 74% случаев, просто найденная - в 7%. Всё, что решает судьбу цитаты, живёт в заголовке и первых 200 символах после него.

Коротко: словарик из четырёх слов

  • labrador - собственный поисковый индекс OpenAI, отдельный от Bing и Google. Именно он отвечает на запросы бесплатных пользователей.
  • bright и oxylabs - сервисы скрапинга, у которых OpenAI покупает живую выдачу Google прямо во время ответа.
  • кеш - общее хранилище уже прочитанных страниц в формате Markdown, одно на всех пользователей.
  • ChatGPT-User - юзер-агент, под которым модель приходит открывать страницу по-настоящему. Ищи его в логах сервера.

Откуда взялись эти цифры

Исследование сделал Оливье де Сегонза, сооснователь французского агентства RESONEO. Метод простой и грубый: расширение для Chrome, которое перехватывает сырой поток данных между браузером и ChatGPT, ещё до того как интерфейс отрисует красивый ответ со ссылками.

Выборка за июль 2026: 1200 ответов, 88 000 результатов поиска, 26 900 разных страниц. В августе автор добил замер новыми режимами размышления. Данные перепроверяли с нескольких типов аккаунтов, из разных стран, повтором тех же запросов через API и подсадными страницами со своими логами сервера.

Важная оговорка автора: система меняется на глазах. Поле result_source, по которому он различал источники, исчезло за одну ночь. Товарные провайдеры обезличили за ту же неделю, токены Google Shopping зашифровали за четыре дня. Цифры ниже - снимок июля и августа 2026. Через месяц часть из них устареет.

Слой 1. Labrador: у OpenAI свой индекс, и это не Bing

Годами повторяли, что ChatGPT ищет через Bing. Данные это хоронят.

Только 1,5% ссылок из labrador встречаются в топ-20 Bing по тому же запросу. Ни один сниппет labrador не совпал с бинговским. Bing жёстко режет заголовки на 75 символах, а самый длинный заголовок в labrador занял 289 символов. Это разные машины с разными правилами.

Labrador работает как дирижёр: он сводит собственные индексы OpenAI с отдельными потоками по Википедии, Reddit, YouTube и новостям. Рядом подключены arXiv, товарные фиды и локальные справочники вроде Yelp и TripAdvisor.

Когда labrador не тянет, включается второй канал: живая выдача Google, купленная у bright и oxylabs. У платного режима размышления в июле 75,3% ссылок пришли именно оттуда, и только 24,7% из labrador. У бесплатного режима картина обратная: 61% labrador и 25,3% на оба скрапера вместе.

Отсюда практический вывод: позиции в Google для тебя всё ещё работают, но только на платных пользователях. Бесплатный тариф видит тебя исключительно глазами labrador, а туда попадают через собственный обход OpenAI, Википедию, Reddit и новости.

Слой 2. Кеш: твою страницу читают один раз на всех

Когда ChatGPT всё-таки открывает страницу, он конвертирует её в Markdown и кладёт в общий кеш. Кеш общий на всех пользователей сервиса, личной копии у тебя нет.

Свежей копия считается около 30 минут. Дальше включается режим «отдай старое, обнови в фоне». В замерах попадались копии, которые отдавались спустя 90 дней после первого захода.

Дальше начинается неприятное. Заголовок Cache-Control: no-store кеш игнорирует. Директиву noindex тоже. Если ты рассчитывал закрыть страницу от чтения стандартными средствами, этот расчёт не сработал.

Жёсткий потолок: 4 МБ на страницу. Тяжелее - страница отвергается целиком, без попытки прочитать хоть что-то. Проверь вес своих самых длинных материалов вместе со встроенными шрифтами и base64-картинками: перевалить за 4 МБ на лонгриде с иллюстрациями проще, чем кажется.

Слой 3. Живое открытие: 759 страниц из 26 900

Вот главная цифра исследования. Из 26 900 разных страниц, которые вообще попали в поле зрения модели, по-настоящему открыты были 759. И все они пришлись на режим размышления.

93%

ответов в быстром бесплатном режиме обходятся без единого открытия страницы

759страниц

реально открыто из 26 900 попавших в выдачу, все в режиме размышления

74%

шанс стать ведущим источником цитаты у открытой страницы против 7% у просто найденной

Причина прозаична и денежная. Больше 90% пользователей ChatGPT сидят на бесплатном тарифе. Бесплатный тариф - это быстрый режим, а быстрый режим ходит только в labrador, потому что скрапинг Google и живое открытие страниц стоят денег. Дорогие инструменты достаются тем, кто платит и готов ждать.

Сколько ссылок берёт каждый режим

РежимСсылок за диалогДоменовОткрывает страницы
Бесплатный, быстрый15,19,8почти нет, 93% ответов без открытий
Бесплатный, режим Think (август)35,316,3нет
Платный Thinking, средняя глубина33,9 (в июле 47,2)15,5да
Платный Thinking, высокая глубина40,5 (в июле 67)14,7да

Ссылок за один диалог, август 2026

Бесплатный быстрый
15,1
Бесплатный Think
35,3
Платный, средний
33,9
Платный, высокий
40,5
Платный высокий, июль
67

Два движения стоит заметить отдельно.

Первое: бесплатный режим Think, появившийся в августе, поднял число собранных ссылок на 135% против быстрого режима. Охват вырос, но открытий страниц там по-прежнему нет.

Второе: платные режимы за месяц сжались. Число веерных подзапросов на диалог упало с 3,56 до 1,90, ссылок стало меньше почти на треть. OpenAI явно режет расходы на инфраструктуру поиска.

И третье, самое полезное для тех, у кого есть свой сайт: оператор site: в запросах модели. В бесплатном быстром режиме он встречается в 3,5% запросов, в платном среднем - в 41,9%, а в платном глубоком - в 58,1% (в конце июля было 40,8%). Модель всё чаще ищет внутри конкретного домена. Значит, внутренний поиск по твоему сайту и осмысленная структура разделов начинают работать напрямую.

Разбираться в механике поиска полезно, но собирать это руками долго. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Что решает, процитируют тебя или нет

Из 61 332 ссылок, всплывших в боковой панели «Источники», ведущим источником за цитатой стали 5 032. Меньше десятой части.

Дальше самое важное соотношение всего исследования. Открытая страница становится источником цитаты в 74% случаев. Найденная, но не открытая - в 7%. Разница больше чем в десять раз.

Есть и странное наблюдение по быстрому режиму: ссылки вообще без сниппета цитируются чаще, чем ссылки со сниппетом, 14,9% против 8,2%. Похоже, когда модели нечего прочитать, она опирается на авторитет самого домена.

Формула: шанс на цитату растёт в два хода. Сначала попасть в выдачу labrador, потом дать модели повод открыть страницу целиком. Второй ход стоит в десять раз дороже первого по результату.

Что машина видит на твоей странице, а что теряет

Сниппет в labrador строится не так, как ты привык. Длина около 200 символов, точка отсчёта - заголовок H1, который в индексе отдаётся капсом. Дальше в сниппет затягивается весь видимый текст вокруг: рубрика, имя автора, дата, оглавление статьи.

Сниппет одинаковый для всех запросов. Один и тот же URL возвращает один и тот же замороженный кусок текста, о чём бы человек ни спросил. Подстройки под запрос нет.

Доходит до модели

  • Полный заголовок страницы, без обрезки по длине
  • Видимый текст сразу после H1, примерно 200 символов
  • Alt-тексты картинок, они переживают конвертацию в Markdown
  • Текст, спрятанный через CSS: его тоже извлекают и читают

Теряется по дороге

  • Meta description: индекс labrador его просто игнорирует
  • Разметка JSON-LD: вырезается при конвертации в Markdown
  • Всё, что рисует JavaScript: скрипты не исполняются
  • Любая страница тяжелее 4 МБ: отвергается целиком

Для сравнения: канал bright, который отдаёт выдачу Google, режет заголовки примерно на 60 символах, а сниппеты на 160. То есть один и тот же материал доходит до модели двумя разными кусками разной длины.

Почему разметку всё равно не выбрасываем

Тут легко сделать поспешный вывод и снести с сайта всю структурированную разметку. Это ошибка.

JSON-LD вырезает конкретно читатель ChatGPT при конвертации в Markdown. Но 75,3% ссылок в платном режиме размышления приходят из скупленной выдачи Google, а Google разметку читает и по ней тебя ранжирует. Meta description точно так же продолжает работать на всех каналах, которые кормятся из Google. Вся базовая настройка из гайда по GEO-оптимизации сайта под нейросети остаётся в силе, просто теперь ты знаешь, на каком именно слое она срабатывает.

Что с этим делать со своей страницей

Заголовок как самостоятельное предложение ≈ 10 мин

  • Labrador не режет длину, до модели доходит весь заголовок
  • Пиши так, чтобы он читался без страницы: тема, суть, год
  • Ключ вставляй естественно, набивка запросами роняет видимость
1

Главное - в первые 200 символов после H1 ≈ 20 мин

  • Именно этот кусок станет замороженным сниппетом на все запросы
  • Разгон «в современном мире» съедает весь бюджет символов
  • Проверь, что между H1 и текстом нет длинного оглавления
2

Alt-тексты у верхних картинок ≈ 10 мин

  • Alt переживает конвертацию и попадает в текст для модели
  • Пиши осмысленно по-русски, «image1.png» тут просто мусор
3

Проверь страницу без JavaScript ≈ 15 мин

  • Отключи скрипты в браузере и перезагрузи статью
  • Всё, что пропало с экрана, для ChatGPT не существует
  • Заодно посмотри вес страницы: потолок 4 МБ
4

Проверить свой текст на первый шаг можно чужими руками. Промпт ниже отдаёт твой заголовок и первый абзац на разбор нейросети именно по этим правилам:

Ты редактор, который готовит статью к цитированию нейропоисковиками.
 
Вот заголовок и первый абзац моей статьи:
ЗАГОЛОВОК: [вставь заголовок]
ПЕРВЫЙ АБЗАЦ: [вставь первые 3-4 предложения]
 
Проверь по шагам и ответь по пунктам:
1. Понятен ли заголовок человеку, который видит только его, без страницы? Что в нём лишнее.
2. Посчитай, сколько символов занимают первые два предложения абзаца. Если больше 200 - покажи, где обрезается смысл.
3. Есть ли в этих 200 символах прямой ответ на вопрос из заголовка. Если нет - напиши, какого факта не хватает.
4. Перепиши первый абзац так, чтобы главный факт с цифрой уместился в первые 200 символов.
 
Пиши по-русски, коротко, без похвалы.

Аналитика врёт: половину визитов ты не видишь

Кликабельные ссылки в ответе ChatGPT приходят с меткой utm_source=chatgpt.com. Это то, что ты видишь в отчётах.

А вот страницы, которые модель открывает во время размышления, приходят вообще без этой метки. Получается, фильтруя трафик по utm, ты считаешь клики людей и полностью теряешь чтения машиной. Между тем именно чтение машиной даёт те самые 74% шанса на цитату.

Смотри логи сервера по юзер-агенту ChatGPT-User. Это единственный честный способ узнать, открывал ли ChatGPT твою страницу целиком. Если в логах он есть, а в аналитике по utm пусто - всё нормально, ты просто смотрел не туда.

Работает ли всё это из России

Сам сайт chat.openai.com из России не открывается, так что первым шагом идёт рабочий VPN с зарубежным адресом. Как поднять и настроить доступ по шагам, разобрано в гайде ChatGPT в России: как пользоваться.

Дальше упирается в тариф. Всё, что связано с реальным открытием страниц, живёт в платном режиме размышления. На бесплатном аккаунте ты увидишь только labrador и его 200-символьные сниппеты. Подписка Plus стоит 20 долларов в месяц, это примерно 1700 рублей по курсу ЦБ на 20 августа 2026 (85,13 рубля за доллар).

Российской картой напрямую оплата не проходит. Варианта два: зарубежная карта или сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Способы и их подводные камни разобраны в гайде как оплатить ChatGPT из России.

Подписка списывается автопродлением каждый месяц, отключается в профиле сервиса. Если платишь через посредника, проверь заранее, как у него устроена отмена: вернуть деньги за лишний месяц там обычно уже не выйдет.

Чего эта картина не объясняет

Честно про дыры, потому что их хватает.

Часть процитированных ссылок не совпадает вообще ни с одним результатом поиска. Автор предполагает, что модель достаёт их из собственной памяти, из весов обучения. Узнаваемый признак: голый корень домена известного сайта, аккуратно снабжённый меткой utm_source=chatgpt.com. Как это уживается с выдуманными фактами, разбирали отдельно в гайде почему нейросеть выдумывает факты.

Второе странное место: arXiv вытаскивался из индекса больше 2600 раз, а процитирован был 10 раз. У Reddit соотношение такое же. Модель массово смотрит эти источники и почти никогда на них не ссылается.

Третье: API не предсказывает продукт. Схожесть выдачи между двумя запусками через API держится на уровне 0,32-0,39 по мере Жаккара, а схожесть между API и живым продуктом падает до 0,23-0,27. Проверять свою видимость в ChatGPT через API бессмысленно, цифры будут про другую систему.

Чек-лист: что у тебя теперь есть

  • Понимание трёх слоёв: индекс labrador, скупленная выдача Google, живое открытие страницы юзер-агентом ChatGPT-User.
  • Знание, что в 93% быстрых ответов твою страницу оценивают по 200 символам возле H1.
  • Заголовок, который читается как самостоятельное предложение и доходит до модели целиком.
  • Главный факт с цифрой в первых 200 символах после заголовка.
  • Осмысленные alt-тексты у верхних картинок.
  • Проверенная страница без JavaScript и с весом до 4 МБ.
  • Мониторинг по логам сервера вместо метки utm, которая теряет чтения в режиме размышления.
  • Трезвое понимание, что вся эта механика может поменяться за неделю, и цифры надо перепроверять.

По материалам исследования RESONEO, опубликованного в Search Engine Land: https://searchengineland.com/chatgpt-retrieval-stack-index-cache-pages-485036

Частые вопросы

ChatGPT ищет через Bing?

Нет. По данным исследования RESONEO за июль 2026, у OpenAI работает собственный индекс под кодовым именем labrador: только 1,5% его ссылок встречаются в топ-20 Bing, и ни один сниппет не совпал с бинговским. Плюс к этому ChatGPT живьём докупает выдачу Google у сервисов скрапинга bright и oxylabs.

Открывает ли ChatGPT мою страницу целиком?

Почти никогда. В быстром режиме 93% ответов обходятся без единого открытия страницы: модель читает только сниппет длиной около 200 символов. Из 26 900 страниц выборки реально открыты были 759, и все они пришлись на режим размышления. Открывать страницу дорого, поэтому это делают в основном для платящих.

Что даёт открытие страницы для цитируемости?

Очень много. Страница, которую ChatGPT реально открыл и прочитал, становится ведущим источником цитаты в 74% случаев. Страница, попавшая в выдачу, но не открытая, цитируется всего в 7% случаев. Разница больше чем в десять раз, и она решает всё.

Учитывает ли ChatGPT разметку JSON-LD и meta description?

Его собственный читатель вырезает JSON-LD при конвертации страницы в Markdown, а meta description индекс labrador игнорирует и строит сниппет из видимого текста возле H1. При этом разметку и описание всё равно оставляют: через них тебя видит Google, а выдачу Google ChatGPT докупает и подмешивает в свои ответы.

Почему в аналитике не видно переходов из ChatGPT?

Часть визитов помечается меткой utm_source=chatgpt.com, но страницы, которые ChatGPT открывает во время размышления, приходят без этой метки. Если фильтровать трафик только по utm, ты считаешь клики и полностью теряешь чтения. Смотреть надо на юзер-агент ChatGPT-User в логах сервера.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.