Контент · 13 мин · обновлено 21 августа 2026 г.

Треть нового интернета пишут нейросети: что это значит для тех, кто ищет и пишет тексты (2026)

Pew Research Center прогнал 490 000 страниц через детектор и нашёл признаки ИИ-авторства у 35% страниц, опубликованных после запуска ChatGPT. Разбираем, как считали, где машинного текста больше всего, какие слова стали маркерами и что с этим делать читателю и автору.

13 мин чтения

Признаки машинного авторства нашлись у 10% всех англоязычных страниц интернета и у 35% страниц, опубликованных после запуска ChatGPT. Это результат исследования Pew Research Center от 20 августа 2026 года: 490 000 страниц из веб-архива Common Crawl прогнали через детектор ИИ-текста. Каждая третья новая страница в вебе теперь несёт следы нейросети.

Ниже разбор методики, полные цифры по зонам сайтов, четыре языковых маркера, которые за три года выросли вдвое, и практическая часть: что с этим делать, если ты ищешь информацию, и что делать, если ты сам пишешь тексты.

Коротко: 10% относится ко всему вебу вместе со старыми страницами, 35% только к тому, что опубликовано после ноября 2022 года. Машинный текст сконцентрирован в коммерческой зоне .com, а в зонах .edu и .gov его около 1%. Детектор ошибается на отдельных документах, поэтому цифра описывает картину в целом и не годится как приговор конкретной статье.

Коротко: пять терминов из статьи

  • Common Crawl - открытый архив интернета. Некоммерческая организация регулярно обходит веб и выкладывает копии страниц, на этих данных учат почти все большие модели.
  • Срез (crawl) - один обход интернета целиком. Pew использовал 49 срезов, по несколько штук в год.
  • Детектор ИИ-текста - модель, которая по статистике выбора слов и построения фраз оценивает вероятность машинного авторства. Не читает смысл, смотрит на форму.
  • Ложное срабатывание - когда детектор помечает человеческий текст как машинный. Главная проблема всей этой сферы.
  • Негативный параллелизм - оборот вида «это не X, это Y». Один из самых узнаваемых почерков больших моделей.

Что именно посчитал Pew и почему этой цифре можно верить

Логика исследования простая, и в этом её сила. Взяли Common Crawl, потому что это единственный публичный слепок интернета, который снимают регулярно и одинаково. Отобрали 49 срезов с января 2021 года по июль 2026 года. Из каждого случайно вытянули по 10 000 англоязычных страниц. Получилось 490 000 страниц, растянутых на пять с половиной лет, причём отсчёт начали за полтора года до появления ChatGPT.

Текст каждой страницы прогнали через открытую модель Pangram на базе Llama 3.2 с 3 миллиардами параметров. Про сам Pangram у нас есть отдельный разбор детекторов ИИ-текста: компания заявляет для своей коммерческой версии одну ошибку на 24 000 документов. Здесь использовали открытую модель, она слабее платной, но зато её результат воспроизводим кем угодно. Модель выдаёт число от 0 до 1, и страницу засчитывали как машинную при значении от 0,2. Чтобы проверить саму себя, Pew прогнал 62 370 страниц ещё и через коммерческий Pangram 3.3: две модели сошлись в 96% случаев.

Дальше две цифры, которые в новостях постоянно путают.

35%

страниц с датой публикации после ноября 2022 года несут признаки ИИ-авторства

10%

всех англоязычных страниц в июльском срезе 2026 года, включая старые

4,6%

страниц в зоне .org, где текстов от нейросетей заметно меньше

Десять процентов - это весь веб целиком. В нём лежат миллиарды страниц, написанных задолго до 2022 года, и они разбавляют картину. Тридцать пять процентов - это только новое. Если тебя интересует, что происходит с интернетом прямо сейчас, вторая цифра честнее.

Как росла доля машинного текста: пять лет по годам

До ноября 2022 года базовая линия держалась около одного процента, и это важная деталь. Она показывает, сколько детектор даёт ложных срабатываний на заведомо человеческом тексте: в 2021 году генеративных моделей в массовом доступе просто не было. Один процент фона - это цена ошибки инструмента, а всё, что выросло сверху, уже реальный сигнал.

Доля страниц с признаками ИИ в зоне .com, по данным Pew

2021
~1%
2023
~2,5%
2024
~3,8%
январь 2026
9,35%

Рост оказался ровным. Никакого обвала интернета в один момент не случилось: доля прибавляла по два-три процентных пункта в год и к 2026 году дошла до каждой десятой страницы в коммерческой зоне. Для сравнения, за это же время примерно половина взрослых американцев начала пользоваться чат-ботами, а 24% делают это ежедневно. Инструмент разошёлся по рукам быстрее, чем успел залить собой веб.

Пока веб заполняется одинаковыми текстами, ценность растёт у того, кто умеет работать с моделью руками, а не кнопкой «сгенерировать». Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.

Пройти мини-курс →

Где нейросетей больше всего: коммерция против университетов

Самый показательный срез исследования - разбивка по доменным зонам за 2026 год. Разрыв там десятикратный.

Признаки ИИ-авторства по зонам, срезы 2026 года

.com
~10%
.org
4,6%
.edu
~1%
.gov
~1%

Логика за этими цифрами понятная. В зоне .com живут интернет-магазины, партнёрские обзоры, блоги компаний и весь пласт контента, который делается ради поискового трафика. Там текст - расходник, и удешевить его производство в десять раз было слишком заманчиво.

В зонах .edu и .gov текст проходит через людей, которые отвечают за него именем и должностью. Университетская страница и методичка ведомства пишутся медленно, правятся долго и не гонятся за частотой публикаций. Единственный процент там - это в основном шум детектора.

Вывод для практики простой. Когда ищешь проверяемый факт, зона домена работает как быстрый фильтр доверия. Гарантии зона домена не даёт, но вероятности смещает заметно.

Четыре языковых маркера, которые выросли вдвое за три года

Отдельно Pew посчитал, как менялся сам язык интернета. Частота даётся на 10 000 слов, сравниваются 2023 и 2026 годы.

Признак20232026Рост
Длинное тире5,7911,19почти вдвое
Оксфордская запятая34,0455,51+63%
Слова из ИИ-словаря11,9426,02больше чем вдвое
Негативный параллелизм0,872,36почти втрое

Под ИИ-словарём имеются в виду английские delve, interplay, testament, pivotal, bolstered, crucial. В русских текстах у этого списка есть прямые аналоги: «погрузимся», «ключевой», «важно отметить», «свидетельство», «в современном мире». Мы про этот набор писали подробно в гайде как убрать запах нейросети из текста.

Отдельно забавно с длинным тире. Его частота удвоилась просто потому, что модели любят этот знак, а люди в обычной переписке почти им не пользуются. По той же причине в редполитике этого сайта длинное тире запрещено целиком: короткое тире, двоеточие или точка делают ту же работу и не звучат как выгрузка из чата.

Ни один из этих признаков сам по себе ничего не доказывает. Человек, который любит оксфордскую запятую и длинное тире, писал так и в 2015 году. Детектор смотрит на статистику выбора слов и построения фраз по всему тексту, отдельный знак для него ничего не значит. Обвинять живого автора на основании одного маркера - самый частый способ обидеть человека зря.

Что этот отчёт не говорит, хотя все так поняли

Заголовки про треть интернета разошлись быстрее самого исследования, и по дороге к цифре прилипло несколько смыслов, которых в ней нет.

Как это читают

  • Треть интернета сгенерирована ботами целиком
  • Поиск теперь бесполезен, живого текста не осталось
  • Детектор точно знает, кто писал страницу
  • Дальше будет только хуже по экспоненте

Что реально в данных

  • Признаки машинного участия, включая правку человеческого текста моделью
  • 65% нового веба по тем же данным написано людьми
  • Детектор ошибается на отдельных документах, надёжен только на больших выборках
  • Рост ровный, по 2-3 процентных пункта в год

Разница между «сгенерировано» и «есть признаки машинного авторства» существеннее, чем кажется. Под второе попадает и текст, который человек написал сам, а потом попросил модель причесать. Формально это правка, но статистика фраз после неё уже машинная. Сколько именно в тех 35 процентах чистой генерации, а сколько отредактированного руками, отчёт не разделяет, и это честно оговорено.

Что это меняет, если ты ищешь информацию

Практическая часть, ради которой всё это стоит читать. Сама возможность найти нужное никуда не делась, выросла цена доверия к первой ссылке.

Смотри на зону домена ≈ 2 сек

  • .gov, .edu, сайты ведомств и вузов: доля ИИ около 1%
  • .com с обзорами и подборками: каждая десятая страница
1

Ищи первоисточник цифры ≈ 1 мин

  • В статье есть ссылка на исследование, а не на пересказ пересказа
  • Указана дата сбора данных и размер выборки
2

Проверь, есть ли в тексте опыт ≈ 30 сек

  • Конкретные суммы, скриншоты, названия кнопок, оговорки про то, что не сработало
  • Сгенерированный обзор всегда гладкий и всегда без провалов
3

Сверь два независимых источника ≈ 2 мин

  • Если обе статьи повторяют одну формулировку дословно, это один источник, а не два
4

Отдельная история с ответами самих нейросетей. Модель отвечает по тому, что нашла в вебе, а веб на треть заполняется машинным текстом. Круг замыкается: генерация цитирует генерацию. Как именно чат-бот выбирает, что открыть и на что сослаться, мы разбирали в гайде как ChatGPT выбирает источники. Короткий вывод: он тянется к структурированным страницам с явными цифрами, и качество исходника проверяет слабо.

Что это меняет, если ты сам пишешь тексты

Здесь новость скорее хорошая, чем плохая, но она требует смены привычки.

Пока конкуренты в твоей нише жали кнопку «сгенерировать статью», средний уровень текста в вебе стал ровным и одинаковым. Ровное и одинаковое перестаёт цеплять и читателя, и алгоритм: ранжировать десять неотличимых обзоров поиску попросту нечем, и он начинает искать признаки чего-то живого.

Три вещи, которые машинный текст пока не подделывает.

Собственные цифры. Сколько ты потратил, сколько заняло по времени, что сломалось на третьем шаге. Модель этого не знает, потому что её там не было.

Скриншот из своего аккаунта. Реальный интерфейс с реальным состоянием бьёт любое описание словами.

Прямая оговорка про ограничения. Фраза «у меня этот способ не заработал на macOS» повышает доверие сильнее, чем ещё один абзац преимуществ.

Про то, как вычищать из своего черновика характерный машинный почерк, у нас есть разбор девяти признаков ИИ-текста с промптом. А если ты делаешь контент под поиск, отдельно посмотри гайд по GEO-оптимизации: правила попадания в ответы нейросетей отличаются от классического SEO сильнее, чем принято думать.

Формула: чем больше в вебе одинакового машинного текста, тем дороже стоит любая деталь, которую нельзя сгенерировать. Личная цифра, свой скриншот и честная оговорка про провал стали главным конкурентным преимуществом автора.

Работает ли это из России и сколько стоит проверка

Само исследование Pew открыто и бесплатно, страница pewresearch.org из России открывается без ухищрений. А вот с инструментами проверки сложнее.

Открытая модель Pangram, на которой считал Pew, лежит на Hugging Face и запускается локально: 3 миллиарда параметров крутятся на обычном ноутбуке с 8 гигабайтами видеопамяти, платить не нужно вообще. Как поднять такую модель у себя, разбирали в гайде про локальные нейросети на видеокарте 8 ГБ. Минус один и существенный: Pew прогонял через неё только англоязычные страницы, а как она ведёт себя на русском, независимо никто не мерил.

Веб-версии западных детекторов часть российских IP отдают с ошибкой, так что для захода понадобится рабочий VPN с зарубежным адресом. Бесплатного лимита GPTZero хватает, чтобы прикинуть картину по одному тексту.

Платные тарифы и API упираются в оплату. Коммерческий Pangram берёт 0,05 доллара за 100 слов по прайсу на июль 2026 года, то есть проверка статьи на 2500 слов обходится примерно в 1,25 доллара, около 100 рублей по курсу августа 2026 года. Российская карта там не пройдёт: нужна зарубежная либо сервис оплаты подписок, который платит за тебя за рубли (реферальная ссылка: тебе тот же прайс, мне небольшой процент).

Если оформляешь подписку на детектор через посредника, сразу проверь условия автопродления. Списание идёт автоматически, отключается в профиле самого сервиса, а не у посредника, и без активной подписки остаток оплаченных проверок сгорает. Разовая проверка одного текста почти всегда дешевле месячного тарифа.

Из российских инструментов на эту задачу работает Антиплагиат.ВУЗ: с 2025 года у него есть отдельный модуль подсветки ИИ-фрагментов, он открывается из России напрямую, но полный отчёт обычно доступен только через вуз.

Чек-лист: что у тебя теперь есть

  • Точные цифры Pew Research Center на 20 августа 2026 года и понимание, чем 35% отличаются от 10%.
  • Разбивка по доменным зонам, которая работает как быстрый фильтр доверия при поиске.
  • Четыре языковых маркера с реальной динамикой за три года и понимание, почему ни один из них не улика по отдельности.
  • Порядок из четырёх шагов для проверки найденной страницы.
  • Три вещи, которые машинный текст не подделывает, и на которые стоит опереться в своих материалах.
  • Понимание, что и почём стоит проверка текста детектором из России.

Главное, что стоит унести. Треть нового веба с машинными следами означает смену фона, а не конец интернета. Раньше плохой текст стоил денег и потому встречался реже. Теперь он бесплатный, и его стало больше. Отличать нормальное от мусора придётся чаще, зато и планка для собственных текстов опустилась ниже, чем когда-либо: чтобы выделиться, достаточно быть настоящим.

По материалам: TechCrunch, «A third of webpages published since ChatGPT’s launch show signs of AI authorship, study finds» и оригинального исследования Pew Research Center, «How Much of the Internet Is Written With AI?».

Частые вопросы

Какая часть интернета написана нейросетью в 2026 году?

По исследованию Pew Research Center от 20 августа 2026 года, значимые признаки ИИ-авторства нашлись у 10% всех англоязычных страниц в июльском срезе Common Crawl. Если брать только страницы, опубликованные после запуска ChatGPT в ноябре 2022 года, доля вырастает до 35%.

Как Pew считал долю ИИ-текста в интернете?

Pew взял 49 срезов веб-архива Common Crawl с января 2021 по июль 2026 года и вытянул из каждого по 10 000 случайных англоязычных страниц, всего 490 000. Текст каждой страницы прогнали через открытую модель-детектор от Pangram на базе Llama 3.2 объёмом 3 миллиарда параметров.

На каких сайтах больше всего текста от нейросетей?

На коммерческих. В срезах 2026 года признаки ИИ-авторства нашлись примерно у каждой десятой страницы в зоне .com, у 4,6% страниц в зоне .org и примерно у 1% в зонах .edu и .gov. Разрыв между коммерцией и госсайтами с университетами почти десятикратный.

Какие слова выдают текст нейросети по данным исследования?

С 2023 по 2026 год в вебе вдвое выросла частота длинного тире и слов из типичного ИИ-словаря вроде delve, pivotal, crucial, testament. Оксфордская запятая стала встречаться на 63% чаще, а конструкция вида «это не X, это Y» почти утроилась. Каждый признак по отдельности ничего не доказывает, работает только их сумма.

Значит ли это, что искать информацию в интернете больше нельзя?

Нет. Доля машинного текста выросла, но 65% нового веба по тем же данным по-прежнему пишут люди, а в зонах .edu и .gov доля ИИ около 1%. Возможность искать никуда не делась, выросла цена доверия к первому попавшемуся результату: проверять источник и первичные данные теперь надо чаще.

Мини-курс «Claude за вечер»

За один вечер настроишь Claude под свои задачи: внутри 35+ промптов, скиллов и агентов. Гарантия возврата 7 дней. Дальше есть Лаборатория ИИ-маркетинга, где из нейросети собирается целый отдел маркетинга.