Как ChatGPT выбирает источники: что он реально открывает и как попасть в его ответы (2026)
Исследование 1200 ответов ChatGPT вскрыло его механику поиска: свой индекс labrador вместо Bing, общий кеш страниц и всего 759 реально открытых страниц из 26 900. Разбираем, что доходит до модели с твоей страницы, что теряется по дороге и какие правки реально поднимают шанс на цитату.
14 мин чтения
ChatGPT добирается до твоего сайта тремя разными путями, и до текста статьи доходит куда меньше страниц, чем принято думать. В исследовании RESONEO по 1200 ответам и 26 900 страницам за июль 2026 модель реально открыла и прочитала 759 страниц. Всё остальное она видела кусочком примерно в 200 символов.
Из этого следует неприятная вещь: в большинстве ответов твою страницу оценивают по заголовку и первому абзацу. До полного текста дело чаще всего не доходит. Ниже разберём, как устроены три слоя поиска ChatGPT, по каким цифрам он решает, кого процитировать, что именно теряется по дороге с твоей страницы и какие правки реально двигают шансы.
У ChatGPT три слоя доступа к вебу: собственный индекс labrador, скупленная живьём выдача Google через сервисы bright и oxylabs, и живое открытие страницы юзер-агентом ChatGPT-User. Открытие страницы стоит дорого, поэтому в быстром режиме 93% ответов обходятся вообще без него. Открытая страница становится источником цитаты в 74% случаев, просто найденная - в 7%. Всё, что решает судьбу цитаты, живёт в заголовке и первых 200 символах после него.
Коротко: словарик из четырёх слов
- labrador - собственный поисковый индекс OpenAI, отдельный от Bing и Google. Именно он отвечает на запросы бесплатных пользователей.
- bright и oxylabs - сервисы скрапинга, у которых OpenAI покупает живую выдачу Google прямо во время ответа.
- кеш - общее хранилище уже прочитанных страниц в формате Markdown, одно на всех пользователей.
- ChatGPT-User - юзер-агент, под которым модель приходит открывать страницу по-настоящему. Ищи его в логах сервера.
Откуда взялись эти цифры
Исследование сделал Оливье де Сегонза, сооснователь французского агентства RESONEO. Метод простой и грубый: расширение для Chrome, которое перехватывает сырой поток данных между браузером и ChatGPT, ещё до того как интерфейс отрисует красивый ответ со ссылками.
Выборка за июль 2026: 1200 ответов, 88 000 результатов поиска, 26 900 разных страниц. В августе автор добил замер новыми режимами размышления. Данные перепроверяли с нескольких типов аккаунтов, из разных стран, повтором тех же запросов через API и подсадными страницами со своими логами сервера.
Важная оговорка автора: система меняется на глазах. Поле result_source, по которому он различал источники, исчезло за одну ночь. Товарные провайдеры обезличили за ту же неделю, токены Google Shopping зашифровали за четыре дня. Цифры ниже - снимок июля и августа 2026. Через месяц часть из них устареет.
Слой 1. Labrador: у OpenAI свой индекс, и это не Bing
Годами повторяли, что ChatGPT ищет через Bing. Данные это хоронят.
Только 1,5% ссылок из labrador встречаются в топ-20 Bing по тому же запросу. Ни один сниппет labrador не совпал с бинговским. Bing жёстко режет заголовки на 75 символах, а самый длинный заголовок в labrador занял 289 символов. Это разные машины с разными правилами.
Labrador работает как дирижёр: он сводит собственные индексы OpenAI с отдельными потоками по Википедии, Reddit, YouTube и новостям. Рядом подключены arXiv, товарные фиды и локальные справочники вроде Yelp и TripAdvisor.
Когда labrador не тянет, включается второй канал: живая выдача Google, купленная у bright и oxylabs. У платного режима размышления в июле 75,3% ссылок пришли именно оттуда, и только 24,7% из labrador. У бесплатного режима картина обратная: 61% labrador и 25,3% на оба скрапера вместе.
Отсюда практический вывод: позиции в Google для тебя всё ещё работают, но только на платных пользователях. Бесплатный тариф видит тебя исключительно глазами labrador, а туда попадают через собственный обход OpenAI, Википедию, Reddit и новости.
Слой 2. Кеш: твою страницу читают один раз на всех
Когда ChatGPT всё-таки открывает страницу, он конвертирует её в Markdown и кладёт в общий кеш. Кеш общий на всех пользователей сервиса, личной копии у тебя нет.
Свежей копия считается около 30 минут. Дальше включается режим «отдай старое, обнови в фоне». В замерах попадались копии, которые отдавались спустя 90 дней после первого захода.
Дальше начинается неприятное. Заголовок Cache-Control: no-store кеш игнорирует. Директиву noindex тоже. Если ты рассчитывал закрыть страницу от чтения стандартными средствами, этот расчёт не сработал.
Жёсткий потолок: 4 МБ на страницу. Тяжелее - страница отвергается целиком, без попытки прочитать хоть что-то. Проверь вес своих самых длинных материалов вместе со встроенными шрифтами и base64-картинками: перевалить за 4 МБ на лонгриде с иллюстрациями проще, чем кажется.
Слой 3. Живое открытие: 759 страниц из 26 900
Вот главная цифра исследования. Из 26 900 разных страниц, которые вообще попали в поле зрения модели, по-настоящему открыты были 759. И все они пришлись на режим размышления.
ответов в быстром бесплатном режиме обходятся без единого открытия страницы
реально открыто из 26 900 попавших в выдачу, все в режиме размышления
шанс стать ведущим источником цитаты у открытой страницы против 7% у просто найденной
Причина прозаична и денежная. Больше 90% пользователей ChatGPT сидят на бесплатном тарифе. Бесплатный тариф - это быстрый режим, а быстрый режим ходит только в labrador, потому что скрапинг Google и живое открытие страниц стоят денег. Дорогие инструменты достаются тем, кто платит и готов ждать.
Сколько ссылок берёт каждый режим
| Режим | Ссылок за диалог | Доменов | Открывает страницы |
|---|---|---|---|
| Бесплатный, быстрый | 15,1 | 9,8 | почти нет, 93% ответов без открытий |
| Бесплатный, режим Think (август) | 35,3 | 16,3 | нет |
| Платный Thinking, средняя глубина | 33,9 (в июле 47,2) | 15,5 | да |
| Платный Thinking, высокая глубина | 40,5 (в июле 67) | 14,7 | да |
Два движения стоит заметить отдельно.
Первое: бесплатный режим Think, появившийся в августе, поднял число собранных ссылок на 135% против быстрого режима. Охват вырос, но открытий страниц там по-прежнему нет.
Второе: платные режимы за месяц сжались. Число веерных подзапросов на диалог упало с 3,56 до 1,90, ссылок стало меньше почти на треть. OpenAI явно режет расходы на инфраструктуру поиска.
И третье, самое полезное для тех, у кого есть свой сайт: оператор site: в запросах модели. В бесплатном быстром режиме он встречается в 3,5% запросов, в платном среднем - в 41,9%, а в платном глубоком - в 58,1% (в конце июля было 40,8%). Модель всё чаще ищет внутри конкретного домена. Значит, внутренний поиск по твоему сайту и осмысленная структура разделов начинают работать напрямую.
Разбираться в механике поиска полезно, но собирать это руками долго. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Что решает, процитируют тебя или нет
Из 61 332 ссылок, всплывших в боковой панели «Источники», ведущим источником за цитатой стали 5 032. Меньше десятой части.
Дальше самое важное соотношение всего исследования. Открытая страница становится источником цитаты в 74% случаев. Найденная, но не открытая - в 7%. Разница больше чем в десять раз.
Есть и странное наблюдение по быстрому режиму: ссылки вообще без сниппета цитируются чаще, чем ссылки со сниппетом, 14,9% против 8,2%. Похоже, когда модели нечего прочитать, она опирается на авторитет самого домена.
Формула: шанс на цитату растёт в два хода. Сначала попасть в выдачу labrador, потом дать модели повод открыть страницу целиком. Второй ход стоит в десять раз дороже первого по результату.
Что машина видит на твоей странице, а что теряет
Сниппет в labrador строится не так, как ты привык. Длина около 200 символов, точка отсчёта - заголовок H1, который в индексе отдаётся капсом. Дальше в сниппет затягивается весь видимый текст вокруг: рубрика, имя автора, дата, оглавление статьи.
Сниппет одинаковый для всех запросов. Один и тот же URL возвращает один и тот же замороженный кусок текста, о чём бы человек ни спросил. Подстройки под запрос нет.
Доходит до модели
- Полный заголовок страницы, без обрезки по длине
- Видимый текст сразу после H1, примерно 200 символов
- Alt-тексты картинок, они переживают конвертацию в Markdown
- Текст, спрятанный через CSS: его тоже извлекают и читают
Теряется по дороге
- Meta description: индекс labrador его просто игнорирует
- Разметка JSON-LD: вырезается при конвертации в Markdown
- Всё, что рисует JavaScript: скрипты не исполняются
- Любая страница тяжелее 4 МБ: отвергается целиком
Для сравнения: канал bright, который отдаёт выдачу Google, режет заголовки примерно на 60 символах, а сниппеты на 160. То есть один и тот же материал доходит до модели двумя разными кусками разной длины.
Почему разметку всё равно не выбрасываем
Тут легко сделать поспешный вывод и снести с сайта всю структурированную разметку. Это ошибка.
JSON-LD вырезает конкретно читатель ChatGPT при конвертации в Markdown. Но 75,3% ссылок в платном режиме размышления приходят из скупленной выдачи Google, а Google разметку читает и по ней тебя ранжирует. Meta description точно так же продолжает работать на всех каналах, которые кормятся из Google. Вся базовая настройка из гайда по GEO-оптимизации сайта под нейросети остаётся в силе, просто теперь ты знаешь, на каком именно слое она срабатывает.
Что с этим делать со своей страницей
Заголовок как самостоятельное предложение ≈ 10 мин
- Labrador не режет длину, до модели доходит весь заголовок
- Пиши так, чтобы он читался без страницы: тема, суть, год
- Ключ вставляй естественно, набивка запросами роняет видимость
Главное - в первые 200 символов после H1 ≈ 20 мин
- Именно этот кусок станет замороженным сниппетом на все запросы
- Разгон «в современном мире» съедает весь бюджет символов
- Проверь, что между H1 и текстом нет длинного оглавления
Alt-тексты у верхних картинок ≈ 10 мин
- Alt переживает конвертацию и попадает в текст для модели
- Пиши осмысленно по-русски, «image1.png» тут просто мусор
Проверь страницу без JavaScript ≈ 15 мин
- Отключи скрипты в браузере и перезагрузи статью
- Всё, что пропало с экрана, для ChatGPT не существует
- Заодно посмотри вес страницы: потолок 4 МБ
Проверить свой текст на первый шаг можно чужими руками. Промпт ниже отдаёт твой заголовок и первый абзац на разбор нейросети именно по этим правилам:
Ты редактор, который готовит статью к цитированию нейропоисковиками. Вот заголовок и первый абзац моей статьи: ЗАГОЛОВОК: [вставь заголовок] ПЕРВЫЙ АБЗАЦ: [вставь первые 3-4 предложения] Проверь по шагам и ответь по пунктам: 1. Понятен ли заголовок человеку, который видит только его, без страницы? Что в нём лишнее. 2. Посчитай, сколько символов занимают первые два предложения абзаца. Если больше 200 - покажи, где обрезается смысл. 3. Есть ли в этих 200 символах прямой ответ на вопрос из заголовка. Если нет - напиши, какого факта не хватает. 4. Перепиши первый абзац так, чтобы главный факт с цифрой уместился в первые 200 символов. Пиши по-русски, коротко, без похвалы.
Аналитика врёт: половину визитов ты не видишь
Кликабельные ссылки в ответе ChatGPT приходят с меткой utm_source=chatgpt.com. Это то, что ты видишь в отчётах.
А вот страницы, которые модель открывает во время размышления, приходят вообще без этой метки. Получается, фильтруя трафик по utm, ты считаешь клики людей и полностью теряешь чтения машиной. Между тем именно чтение машиной даёт те самые 74% шанса на цитату.
Смотри логи сервера по юзер-агенту ChatGPT-User. Это единственный честный способ узнать, открывал ли ChatGPT твою страницу целиком. Если в логах он есть, а в аналитике по utm пусто - всё нормально, ты просто смотрел не туда.
Работает ли всё это из России
Сам сайт chat.openai.com из России не открывается, так что первым шагом идёт рабочий VPN с зарубежным адресом. Как поднять и настроить доступ по шагам, разобрано в гайде ChatGPT в России: как пользоваться.
Дальше упирается в тариф. Всё, что связано с реальным открытием страниц, живёт в платном режиме размышления. На бесплатном аккаунте ты увидишь только labrador и его 200-символьные сниппеты. Подписка Plus стоит 20 долларов в месяц, это примерно 1700 рублей по курсу ЦБ на 20 августа 2026 (85,13 рубля за доллар).
Российской картой напрямую оплата не проходит. Варианта два: зарубежная карта или сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Способы и их подводные камни разобраны в гайде как оплатить ChatGPT из России.
Подписка списывается автопродлением каждый месяц, отключается в профиле сервиса. Если платишь через посредника, проверь заранее, как у него устроена отмена: вернуть деньги за лишний месяц там обычно уже не выйдет.
Чего эта картина не объясняет
Честно про дыры, потому что их хватает.
Часть процитированных ссылок не совпадает вообще ни с одним результатом поиска. Автор предполагает, что модель достаёт их из собственной памяти, из весов обучения. Узнаваемый признак: голый корень домена известного сайта, аккуратно снабжённый меткой utm_source=chatgpt.com. Как это уживается с выдуманными фактами, разбирали отдельно в гайде почему нейросеть выдумывает факты.
Второе странное место: arXiv вытаскивался из индекса больше 2600 раз, а процитирован был 10 раз. У Reddit соотношение такое же. Модель массово смотрит эти источники и почти никогда на них не ссылается.
Третье: API не предсказывает продукт. Схожесть выдачи между двумя запусками через API держится на уровне 0,32-0,39 по мере Жаккара, а схожесть между API и живым продуктом падает до 0,23-0,27. Проверять свою видимость в ChatGPT через API бессмысленно, цифры будут про другую систему.
Чек-лист: что у тебя теперь есть
- Понимание трёх слоёв: индекс labrador, скупленная выдача Google, живое открытие страницы юзер-агентом ChatGPT-User.
- Знание, что в 93% быстрых ответов твою страницу оценивают по 200 символам возле H1.
- Заголовок, который читается как самостоятельное предложение и доходит до модели целиком.
- Главный факт с цифрой в первых 200 символах после заголовка.
- Осмысленные alt-тексты у верхних картинок.
- Проверенная страница без JavaScript и с весом до 4 МБ.
- Мониторинг по логам сервера вместо метки utm, которая теряет чтения в режиме размышления.
- Трезвое понимание, что вся эта механика может поменяться за неделю, и цифры надо перепроверять.
По материалам исследования RESONEO, опубликованного в Search Engine Land: https://searchengineland.com/chatgpt-retrieval-stack-index-cache-pages-485036
Частые вопросы
ChatGPT ищет через Bing?
Нет. По данным исследования RESONEO за июль 2026, у OpenAI работает собственный индекс под кодовым именем labrador: только 1,5% его ссылок встречаются в топ-20 Bing, и ни один сниппет не совпал с бинговским. Плюс к этому ChatGPT живьём докупает выдачу Google у сервисов скрапинга bright и oxylabs.
Открывает ли ChatGPT мою страницу целиком?
Почти никогда. В быстром режиме 93% ответов обходятся без единого открытия страницы: модель читает только сниппет длиной около 200 символов. Из 26 900 страниц выборки реально открыты были 759, и все они пришлись на режим размышления. Открывать страницу дорого, поэтому это делают в основном для платящих.
Что даёт открытие страницы для цитируемости?
Очень много. Страница, которую ChatGPT реально открыл и прочитал, становится ведущим источником цитаты в 74% случаев. Страница, попавшая в выдачу, но не открытая, цитируется всего в 7% случаев. Разница больше чем в десять раз, и она решает всё.
Учитывает ли ChatGPT разметку JSON-LD и meta description?
Его собственный читатель вырезает JSON-LD при конвертации страницы в Markdown, а meta description индекс labrador игнорирует и строит сниппет из видимого текста возле H1. При этом разметку и описание всё равно оставляют: через них тебя видит Google, а выдачу Google ChatGPT докупает и подмешивает в свои ответы.
Почему в аналитике не видно переходов из ChatGPT?
Часть визитов помечается меткой utm_source=chatgpt.com, но страницы, которые ChatGPT открывает во время размышления, приходят без этой метки. Если фильтровать трафик только по utm, ты считаешь клики и полностью теряешь чтения. Смотреть надо на юзер-агент ChatGPT-User в логах сервера.