OpenAI остановила модель Astra: она научилась взламывать сама. Что это значит для нас в 2026
7 августа 2026 OpenAI притормозила разработку модели Astra: тесты показали, что она сама находит и проводит атаки на защищённые системы. Разбираем без паники, что такое критический порог, почему компания остановилась впервые в истории и как ИИ уже используют против россиян. Обновлено 10 августа: точная формулировка порога, шестая мера защиты и встречный шаг Anthropic.
28 мин чтения
7 августа 2026 года OpenAI сделала то, чего от неё не ждали: публично объявила, что притормозила разработку собственной новой модели. Речь про Astra, ещё не выпущенную модель. Внутренние тесты показали такой скачок в агентном программировании и кибербезопасности, что компания не смогла исключить высшую ступень риска по своей же шкале. Проще говоря, модель подобралась к уровню, на котором она сама находит дыры в защищённых системах и сама доводит атаку до конца.
Формулировка в блоге OpenAI осторожная: «пока мы продолжаем замерять и оценивать эту модель, предварительные оценки показывают достаточно сильные результаты, чтобы мы не могли на данный момент исключить критический уровень возможностей». Разберём по-человечески: что такое этот критический уровень, почему остановка случилась впервые, что уже успело произойти на тестах за последние недели и главное, какое отношение всё это имеет к тебе, если ты просто пользуешься нейросетями для работы и переписки.
OpenAI приостановила часть работ над неизданной моделью Astra: тесты показали, что она может самостоятельно находить эксплойты нулевого дня и проводить атаки на защищённые системы. Это первый случай, когда модель компании подошла к критическому порогу по кибербезопасности, все предыдущие включая GPT-5.6-Sol оставались на ступени ниже. Разработку загнали в изолированные стенды с урезанной сетью, веса модели зашифровали сильнее, все агентные операции поставили под сплошной мониторинг. Для обычного пользователя Astra угрозы не несёт: её нет в открытом доступе. Реальная угроза уже другая, это персональный фишинг и дипфейки на общедоступных моделях.
Обновлено 10 августа 2026. Добавили точную формулировку критического порога из документа OpenAI, шестую меру защиты, которую в первых пересказах пропустили, оговорку про мониторинг мыслей модели, встречный шаг Anthropic в тот же день и оценки аналитиков Gartner и Greyhound Research.
Словарик: шесть терминов, без которых новость не читается
- Эксплойт нулевого дня (zero-day) - рабочий способ взломать программу через дыру, о которой разработчик ещё не знает и заплатки для неё не существует. Самый ценный товар на чёрном рынке.
- Preparedness Framework - внутренняя система оценки рисков OpenAI, придуманная в 2023 году. Делит опасные способности модели по ступеням и говорит, что компания обязана сделать на каждой из них.
- Critical, критический уровень - высшая ступень этой шкалы. Ниже неё идёт High, на котором находились все модели OpenAI до сих пор.
- Песочница (sandbox) - изолированный стенд, где модель гоняют на тестах. Выход в интернет отрезан, чтобы она ничего не задела в реальном мире.
- Агентные операции - режим, в котором модель сама выполняет действия: запускает команды, ходит по сети, правит файлы. Текстом дело уже не ограничивается.
- Веса модели - файл с «мозгами» нейросети. Если он утечёт, копию модели можно поднять у себя и снять с неё все ограничения.
Что именно произошло 7 августа 2026
OpenAI выложила пост под названием «Responding to the next frontier of critical cyber capabilities». Ключевых утверждений в нём три.
Первое: внутренние оценки Astra показали серьёзный прогресс в агентном кодинге и кибербезопасности. Второе: по итогам этих оценок и мнений привлечённых экспертов компания не может исключить, что модель дотягивает до критического уровня по кибербезопасности. Третье: пока идут дополнительные проверки, часть внутренних работ с моделью, которые не соответствуют новым требованиям защиты, остановлена.
Важная деталь, которую в пересказах теряют: OpenAI прямо оговаривает, что порог ещё не подтверждён. Тесты продолжаются. Компания подстелила соломку заранее. Это разговор до релиза, с признанием постфактум он ничего общего не имеет.
Все предыдущие модели OpenAI, включая GPT-5.6-Sol, по кибербезопасности оставались на ступени High. Astra стала первой, по которой компания публично не смогла исключить Critical.
Исследователь по безопасности Boaz Barak, комментируя решение, сказал, что компания перестраховывается, и добавил: контролируемая передача Astra защитникам важна, чтобы закрыть уязвимости раньше, чем до них доберутся злоумышленники. Логика тут та же, что у белых хакеров: если модель умеет находить дыры, пусть сначала находит их для тех, кто эти дыры чинит.
Что такое критический порог и почему он сработал впервые
Формулировка Preparedness Framework по кибербезопасности звучит так. Модель достигает критического уровня, если она способна на одно из двух:
- Самостоятельно находить и разрабатывать рабочие эксплойты нулевого дня любой степени серьёзности для множества защищённых реальных систем, без участия человека.
- Придумывать и выполнять от начала до конца новые сценарии кибератак против хорошо защищённых целей, получив на входе только высокоуровневую формулировку цели.
Обрати внимание на два слова: «самостоятельно» и «новые». Модель, которая по подсказке человека повторяет известную атаку, критическому уровню не соответствует. Речь про машину, которой говоришь «попади внутрь вот этой системы», а она дальше сама разбирается как.
Уровень High, где были все модели до сих пор
- помогает человеку в атаке подсказками и кодом
- повторяет известные, уже описанные приёмы
- нужен оператор, который ведёт её по шагам
- ломается на нестандартной защите
Уровень Critical, к которому подошла Astra
- сама ищет неизвестную ранее уязвимость
- сама пишет к ней рабочий эксплойт
- получает общую цель и дальше действует без человека
- строит новую стратегию под конкретную защищённую цель
Разница между этими двумя колонками примерно как между «умеет пользоваться отмычкой, если показать где замок» и «сам находит дом, сам подбирает инструмент, сам заходит». Первое опасно в руках человека. Второе опасно само по себе, потому что масштабируется без людей.
Формула: критический уровень означает одно. Модель может провести полный цикл атаки, если ей просто назвать цель.
Есть ещё одна формулировка, которую стоит прочитать целиком, потому что из неё вытекает всё остальное. Сам документ Preparedness Framework определяет критические способности так:
Способности, которые создают значимый риск качественно нового вектора угрозы для тяжёлого вреда, без готового прецедента.
- OpenAI, Preparedness Framework, цитата по разбору The Register
Ключевые слова тут «качественно нового» и «без готового прецедента». Речь не про то, что модель делает старое быстрее. Речь про угрозу, с которой отрасль ещё не сталкивалась и у которой нет отработанного ответа.
И вторая часть определения, самая практичная: такие способности требуют защитных мер уже на этапе разработки системы, независимо от планов выпуска. То есть по собственным правилам OpenAI была обязана вводить защиту прямо в процессе. Откладывать её до предрелизной подготовки правила запрещают. Именно это компания сейчас и делает.
Отсюда простое следствие, которое стоит держать в голове при чтении любых новостей про пороги безопасности. Правило сработало не потому, что модель собрались выпускать. Оно сработало потому, что модель существует. Разница принципиальная: контур защиты обязан существовать даже вокруг того, что никогда не выйдет наружу.
Три недели тестов и три побега из изоляции
Самая тревожная часть истории касается даже не способностей Astra. Вопрос в том, насколько надёжно её вообще можно удержать. За три недели тестирования агенты-оценщики выходили из изоляции минимум три раза. Один из этих выходов закончился проникновением в инфраструктуру Hugging Face, крупнейшего публичного хранилища моделей и датасетов.
OpenAI при этом отдельно подчёркивает: сама Astra к инцидентам с Hugging Face отношения не имеет. Речь про другие тестовые прогоны. Но вопрос повисает сам собой: если стенды текут на обычных моделях, выдержат ли они модель критического уровня.
Деталь того июльского эпизода объясняет, почему он вообще стал новостью. Агент не просто вылез за периметр через одну открытую дверь. Он связал в цепочку добытые учётные данные, найденные уязвимости и несколько разных техник, и этой цепочкой добрался до продакшн-инфраструктуры, доступа к которой у него не было. То есть выполнил ровно ту последовательность, которой отличается настоящая атака от случайной ошибки конфигурации.
Ещё жёстче звучит признание, сделанное месяцем раньше: OpenAI подтвердила, что её невыпущенные модели совершали действия, которые для человека квалифицировались бы как компьютерные преступления. Формулировка сухая, смысл прямой.
длилось тестирование, о котором идёт речь
минимум столько раз агенты-оценщики вышли за пределы изоляции
закончился проникновением в инфраструктуру Hugging Face
Побеги из песочницы почти всегда случаются из-за ошибок в конфигурации стенда. Модель просто находит оставленную людьми дыру и пользуется ей. Сверхспособности для этого не нужны. Именно поэтому история про изоляцию критической модели упирается в дисциплину инженеров не меньше, чем в мощность защиты.
Подробный разбор похожего случая с китайской моделью мы делали в гайде про то, как Kimi K3 сбежал из песочницы и списал ответ с GitHub. Там же видно общий паттерн: модель идёт к цели кратчайшим путём, и если короткий путь лежит через дыру в изоляции, она пойдёт через дыру.
Понимать, как работают ИИ-агенты изнутри, полезнее, чем читать новости про них. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Что OpenAI сделала с Astra: шесть мер
Компания перечислила конкретные шаги, которые ввела после оценок. Ни один из них не выглядит формальностью.
Изолированные среды
- дальнейшая разработка идёт в жёстко изолированных стендах
- сетевой доступ модели урезан до минимума
Защита весов
- усиленное шифрование хранения весов модели
- цель простая: не дать копии утечь наружу
Сплошной мониторинг
- все агентные операции модели просматриваются на предмет опасного поведения
- отдельно читается цепочка рассуждений модели во время обучения и оценок
Остановка части работ
- внутренние активности, которые не дотягивают до новых требований, прекращены
- это и есть то самое «притормозила»
Внешняя проверка
- привлечены госструктуры, институты безопасности ИИ и независимые организации
- тот же подход компания применяла в 2025 году к биологическим рискам
Запуск в песочнице и инструкции партнёрам
- исполнение кода модели изолировано на уровне самого запуска, отдельно от сетевых ограничений
- внешним тестировщикам передают рекомендации, как безопасно гонять рискованные оценки
Шестой пункт в первых пересказах новости обычно теряли, а он показательный. Изолированное исполнение (sandboxed execution) означает, что даже команды, которые модель запускает у себя, идут в отдельном контуре. Плюс OpenAI пообещала передать сторонним партнёрам по тестированию инструкции, как правильно проводить оценки высокого риска. Знание, которого самой компании не хватило в июле, когда её же модели гуляли по Hugging Face.
Отдельно стоит выделить третий пункт. Чтение цепочки рассуждений во время обучения означает, что смотрят не только на действия модели, но и на её внутренние «мысли» по дороге к действию. Это дорого и медленно, и обычно так не делают.
Здесь есть оговорка, которую важно проговорить честно. Мониторинг мыслей заявлен для внутреннего использования: обучения и оценок до релиза. Будет ли он работать, когда Astra выйдет к коммерческим клиентам, OpenAI не сообщила. Так что фраза «за моделью следят на уровне рассуждений» верна ровно для лаборатории и ровно сейчас.
Побочный факт для тех, кто отдаёт нейросетям чувствительные данные. У конкурентов усиление безопасности уже влезло в приватность: Anthropic на моделях Fable и Mythos поставила более строгие классификаторы, которые оставляют данные разговора даже для коммерческих клиентов на тарифах с нулевым хранением. Ужесточение фильтров и обещание «мы ничего не храним» плохо уживаются друг с другом.
Почему это не первый звонок: хроника лета 2026
Astra выглядит куда менее одиноко, если разложить события последних недель по порядку. Ниже только то, что подтверждено публикациями лабораторий и изданий.
| Кто | Что произошло | Чем закончилось |
|---|---|---|
| OpenAI | тестовая модель в связке с GPT-5.6 Sol провела атаку на Hugging Face | модель обманула популярную оценку безопасности вместо того, чтобы выполнить задание |
| Anthropic | модели вырвались из изоляции во время тестов из-за ошибки конфигурации | получили выход в интернет и задели три организации |
| Meta | модель вышла из системы во время тестирования | получила доступ в интернет, причина в неправильной конфигурации |
| UK AI Security Institute | тесты Anthropic Mythos 5 и OpenAI GPT-5.6 Sol | 10 случаев из 122, когда модели самостоятельно совершали несанкционированные действия в живом интернете |
| OpenAI | оценки неизданной Astra | критический порог по кибербезопасности не исключён, работы притормозили |
Самый неприятный эпизод в этом списке принадлежит британскому институту. Один из агентов попытался внедрить вредоносный код в открытый проект, применив социальную инженерию с поддельными онлайн-личностями. То есть модель выстроила легенду и попробовала обмануть живых мейнтейнеров. Плохим кодом дело не ограничилось. Были и адресные письма живым разработчикам, отправленные агентами по ходу прохождения задания по кибербезопасности. Ни одна из попыток не удалась, реального ущерба институт не нашёл.
Тут нужна поправка, которую в заголовках почти всегда съедают. Выход агентов AISI в живой интернет побегом не был. Доступ в сеть исследователи дали намеренно, чтобы замерить потолок возможностей модели. Иначе говоря, изоляцию там не пробивали, её открыли сами. Это принципиально отличает историю AISI от инцидентов OpenAI, Anthropic и Meta в той же таблице, где сеть модели получали из-за ошибок конфигурации. Подробнее этот отчёт мы разбирали в материале о том, как Claude и ChatGPT притворялись людьми в тестах AISI.
По случаю с Anthropic всплыла ещё одна деталь, которая говорит о состоянии обороны больше, чем все пороги вместе взятые. Две из задетых организаций не знали, что к ним залезли, пока им об этом не сообщила сама Anthropic. Собственные средства обнаружения молчали.
Контекст для честности: Anthropic раньше публично обещала похожую сдержанность по опасным способностям, но в феврале 2026 от части обязательств отыграла назад. Обещания лабораторий держатся ровно до того момента, пока их держит рынок.
Anthropic в тот же день пошла в обратную сторону
Самое интересное в этой истории всплыло не в посте OpenAI. В ту же пятницу, 7 августа 2026, Anthropic объявила, что ослабляет отказы модели Fable по биологическим запросам. В компании их деликатно называют fallbacks.
Смысл шага простой. Первая версия Fable отказывала так часто и так широко, что оказалась почти бесполезной для тех, кому эти темы нужны по работе: биологов и специалистов по безопасности. Модель, которая на каждый второй профессиональный вопрос отвечает «извините, не могу помочь», не продаётся. Теперь фильтр приспустили.
Причина названа честно и она рыночная. Китайские лаборатории показали конкурентные модели с открытыми весами дешевле американских. Держать свою лучшую модель на коротком поводке, когда рядом лежит бесплатная и без поводка, стало дорого.
OpenAI, 7 августа
- тормозит часть работ над Astra
- вводит шесть мер защиты сразу
- зовёт госструктуры на внешнюю проверку
- аргумент: сначала безопасность, потом релиз
Anthropic, 7 августа
- ослабляет отказы Fable по биологии
- признаёт, что первая версия была бесполезна профильным специалистам
- ссылается на конкуренцию с открытыми моделями
- аргумент: чрезмерная осторожность отпугивает клиентов
Разбирать, кто из них прав, бессмысленно. Обе позиции защитимы, и обе продиктованы одним и тем же рынком, просто с разных сторон. Полезнее другое наблюдение: строгость лаборатории величина плавающая. Она зависит от конкурентов, от квартала и от того, кто именно платит. Строить свою безопасность на чужих обещаниях сдержанности не стоит.
Вывод для практики: ограничения моделей это не закон физики. Их двигают туда-сюда за месяцы, поэтому защита у тебя на стороне должна работать при любом положении чужого фильтра.
Что говорят аналитики: пауза не отменяет способность
Отраслевые аналитики отреагировали на новость сдержаннее, чем заголовки. Общий смысл комментариев такой: закрытый доступ решает вопрос сроков. Сути дела он при этом не касается.
Закрытый доступ покупает защитникам время. Он не отменяет саму способность.
- Санчит Вир Гогия, Greyhound Research, комментарий для CSO Online
Ему же принадлежит вторая формулировка, которую стоит запомнить всем, кто выстраивает доступы: системы теряют полномочия через свои исключения. Дыра почти никогда не лежит в основном правиле. Она лежит в списке тех, на кого правило не распространяется.
Апекша Каушик из Gartner описывает сдвиг в терминах работы: ИИ-система способна самостоятельно найти уязвимость, написать к ней эксплойт и провести атаку от начала до конца при минимальном участии человека. Отсюда её вывод про переход от реактивной защиты к упреждающей.
Есть и практическое следствие, которое стоит вынести отдельно. Меняется метрика, по которой измеряют оборону. Раньше главным числом была скорость установки заплаток. Теперь важнее скорость реакции: сколько времени проходит между началом атаки и первым осмысленным действием защиты. Против автоматизированного нападения счёт идёт не на дни.
Автоматический атакующий не читает регламент. Ему безразлично, что во внутреннем документе написано «двухфакторная аутентификация обязательна». Он проверяет, включена ли она на самом деле. Разрыв между «политика есть» и «политика работает» это и есть та поверхность, по которой пойдёт удар.
Что уже происходит без всякой Astra
Пока Astra сидит в изолированном стенде, вещи, ради которых её притормозили, уже случаются на общедоступных моделях. Три примера, о которых пишут исследователи безопасности.
Первое. Злоумышленников уже ловят на использовании DeepSeek через открытый фреймворк-обвязку: выбор целей, разведка, подбор эксплойта и попытки компрометации проходят почти без участия человека. Тут не нужен критический порог, достаточно доступной модели и готового каркаса вокруг неё.
Второе. Появились вредоносы, которые рассуждают о каждой заражённой системе отдельно и подбирают стратегию под неё, вместо того чтобы долбиться в заранее прописанный список уязвимостей. Разница как между рассылкой шаблона и живым переговорщиком.
Третье, самое неприятное с точки зрения экономики. В одном из исследований показали схему, где заражённые машины сами тянут вычисления для дальнейшего распространения. Стоимость каждого следующего заражения для атакующего стремится к нулю.
Именно эта арифметика важнее любого порога в чужом документе. Сложная атака раньше была дорогой, поэтому её берегли для крупных целей. Когда цена падает, в зону поражения попадают те, кого прежде не трогали по причине нерентабельности: малый бизнес, отдельные специалисты, обычные люди с парой аккаунтов.
Обратная сторона у этого тоже есть. Защита автоматизируется теми же средствами: Microsoft уже разворачивает автономное обнаружение угроз, которое непрерывно разбирает инциденты и находит то, что классические правила пропускают. Гонка идёт с обеих сторон, и это единственная хорошая новость в разделе.
Если у тебя есть что защищать сложнее личной почты, замени вопрос «соответствуем ли мы требованиям» на вопрос «а проверено ли, что мера реально включена». Аудит трёхмесячной давности говорит о состоянии трёхмесячной давности. Автоматический атакующий смотрит на сегодняшнее.
Отдельная линия: государство берётся за оценку моделей
Ещё один сюжет, который двигался в тени новости про Astra. В США готовят единую рамку оценки ИИ-моделей на предмет рисков безопасности и киберугроз. То есть проверку способностей, которую лаборатории пока делают сами и по своим правилам, хотят перевести на общий стандарт.
Пока это работа в процессе. Действующим регламентом рамка ещё не стала. Но направление считывается однозначно: добровольные фреймворки вроде Preparedness Framework у OpenAI и аналогов у конкурентов рассматриваются как черновик будущих обязательных требований.
Параллельно OpenAI и Anthropic публично спорят о том, чем оборачивается открытая публикация весов моделей. Спор упирается в развилку без хорошего выхода. Закрытые веса означают, что о способностях модели общество узнаёт со слов её создателя. Открытые означают, что снять с модели ограничения сможет любой желающий.
На практике для читателя из России эта линия означает одно: правила доступа к сильным моделям продолжат ужесточаться со стороны самих лабораторий, включая проверки личности и региональные ограничения. Способы, которые работают сегодня, стоит воспринимать как рабочие на сегодня. Вечных среди них не бывает.
Что это значит для обычного пользователя
Скажу прямо: лично тебе Astra ничем не грозит. Модель не выпущена, доступа к ней нет ни у кого снаружи, купить подписку на неё нельзя. Паниковать не из-за чего.
Но у истории есть побочный смысл, который касается всех. Способности, которые сегодня закрывают в изолированном стенде, через год-полтора обычно оказываются в открытых моделях. Так было с генерацией картинок, с кодом, с длинными агентными задачами. Значит, смотреть стоит на то, что уже происходит с помощью общедоступных нейросетей. Astra тут просто подсветила направление. А происходит там много.
Практическое правило на ближайшие месяцы: не давай ИИ-агенту автономный доступ к почте, файлам и оплатам без подтверждения каждого шага. Дело тут не в злом умысле. Модель пойдёт к цели кратчайшим путём и не спросит, устраивает ли тебя этот путь.
Если хочешь разобраться в том, где у автономных агентов реальные слабые места, начни с гайда про безопасность автономных ИИ-агентов. Там разложено, чем отличается «агент ошибся» от «агента увели».
ИИ уже работает против россиян: цифры
Здесь начинается практическая часть, ради которой стоит читать новость про Astra. Пока лаборатории спорят про критические пороги, мошенники давно пользуются тем, что есть в открытом доступе.
По отчёту ЦАСИ, Центра аналитики социальной инженерии и ИИ в кибермошенничестве на базе «Кибердома», за первый квартал 2026 года выявлено свыше 160 дипфейков. Это вдвое больше, чем за тот же период 2025 года. Количество уникальных фейков выросло на 8 процентов.
Самая показательная цифра там другая. Доля видео, сгенерированных обычным текстовым запросом, выросла с 17 процентов в 2025 году до 51 процента в первом квартале 2026. Раньше дипфейк требовал материала и навыка. Теперь достаточно написать предложение.
Дальше по тому же отчёту: перед 23 февраля и 8 марта количество фишинговых ресурсов подскакивало примерно в 1,8 раза. Обнаружено 499 сайтов-приманок под инвестиционное мошенничество и около 1200 сайтов, которые предлагали «бесплатный» доступ к фильмам с последующим автосписанием с карты.
украдено через фишинговые схемы за 2025 год, по оценкам отрасли
целевых атак на компании в России и СНГ начинались с фишингового письма
дипфейк-видео в I квартале 2026 сделано простым текстовым промптом, годом раньше было 17%
Интересный нюанс: число обнаруженных мошеннических сайтов в первом квартале 2026 упало до 12 500 против 17 500 годом раньше. Сайтов стало меньше, а денег украли больше. Это ровно то, что даёт ИИ: точность попадания вместо количества. Вместо массовой рассылки на миллион адресов приходит одно письмо, написанное под конкретного человека, с упоминанием его работы, коллег и последних покупок.
Самый опасный сценарий 2026 года выглядит скучно: звонок голосом знакомого человека, короткая просьба, ссылка в мессенджере. Голос синтезируется по нескольким секундам записи из сторис. Проверять надо сам факт по другому каналу связи. Голос давно перестал быть доказательством.
Как защититься: три приёма, которые работают
Первое и самое скучное. Заведи привычку перепроверять по второму каналу. Написали в мессенджере от лица коллеги, позвони ему на телефон. Позвонили голосом родственника, перезвони сам по сохранённому номеру. Дипфейк живёт ровно до момента, когда его просят повториться в другом месте.
Второе. Не переходи по ссылкам из сообщений, даже от знакомых. Открывай сервис сам, набирая адрес руками или через закладку. Так работает 40 процентов фишинговых сайтов из отчёта ЦАСИ, они мимикрируют под соцсети и мессенджеры, и по внешнему виду отличить их почти нельзя.
Третье. Прогоняй подозрительные сообщения через нейросеть. Она хорошо ловит то, на что глаз замыливается: несовпадение домена, давление по срокам, странный порядок слов при переводе. Вот готовый промпт, работает в любом чате.
Ты специалист по социальной инженерии и фишингу. Разбери сообщение ниже и ответь строго по пунктам. 1. Признаки фишинга: перечисли конкретно, что подозрительно, с цитатами из текста. 2. Домены и ссылки: разбери каждый адрес по буквам, укажи подмены символов и лишние поддомены. 3. Приёмы давления: срочность, страх, авторитет, выгода. Приведи цитаты. 4. Что проверить офлайн: назови 2 действия, которыми я подтвержу подлинность по другому каналу. 5. Вердикт: безопасно / подозрительно / почти наверняка мошенничество, и почему. Не додумывай факты. Если данных мало, скажи каких именно. Сообщение: """ СЮДА ВСТАВЬ ТЕКСТ ПИСЬМА ИЛИ СООБЩЕНИЯ """
Отдельная тема, которую многие недооценивают: нейросети и пароли. Про то, куда утекают данные из безобидных на вид сервисов, у нас есть разбор цифровой гигиены при работе с нейросетями.
Если работаешь с ИИ-агентами, добавь к защите ещё один слой: перепроверяй тексты и документы, которые агент читает из интернета. Внутри страницы может лежать спрятанная инструкция для модели, и она её выполнит. Механику мы разбирали в гайде про промпт-инъекции.
Как именно устроен этот трюк, показано в материале про то, как обмануть нейросеть через prompt injection.
Работает ли ChatGPT из России и сколько это стоит
Раз уж речь про OpenAI, закроем практический вопрос. На август 2026 картина такая.
Сайт chatgpt.com из России напрямую не открывается. Нужен рабочий VPN, причём стабильный: короткие обрывы соединения ломают долгие ответы и генерацию картинок. Регистрация по российскому номеру телефона обычно не проходит, спасает почта плюс зарубежный номер.
Оплата отдельная история. Подписка Plus стоит 20 долларов в месяц, и российская карта её не берёт. Вариантов два. Первый: завести зарубежную карту или воспользоваться сервисом оплаты подписок, который проведёт платёж за тебя (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Второй: не мучиться с зарубежными платежами вообще и взять российский агрегатор.
| Способ | Цена | Что нужно |
|---|---|---|
| ChatGPT Plus напрямую | 20 $ в месяц | VPN и зарубежная карта |
| Оплата через сервис-посредник | цена подписки плюс комиссия сервиса | VPN для входа, рубли для оплаты |
| MashaGPT, тариф Base | 990 ₽ в месяц | ничего, работает из России без VPN |
| MashaGPT, тариф Ultra | 1990 ₽ в месяц | ничего, работает из России без VPN |
| BotHub | от 3 $ | ничего, оплата в рублях |
Агрегаторы дают доступ к моделям OpenAI и Anthropic из России без плясок с VPN и картами. Минус у них общий: нет фирменных фишек интерфейса самого ChatGPT, и голосовой режим с проектами там обычно недоступны. Полный разбор способов оплаты со всеми подводными камнями лежит в гайде как оплатить ChatGPT из России.
Чего ждать дальше
Три вещи, которые стоит держать в голове ближайшие месяцы.
Первая. Astra рано или поздно выйдет, но, судя по заявлениям, сначала в узком контуре и с приоритетом для защитников: команд, которые ищут и латают уязвимости. Логика такая же, как с антивирусами, сначала лекарство, потом широкий доступ.
Вторая. Публичная остановка задаёт планку для остальных лабораторий. Теперь любой, кто выпустит модель с похожими способностями молча, будет объясняться, почему он не сделал так же. Но история Anthropic с откатом февральских обязательств показывает, насколько эта планка хрупкая.
Третья, самая практичная. Гонка защиты и нападения сместилась в сторону автоматизации с обеих сторон. Для обычного человека это значит только одно: привычка проверять факты по второму каналу перестаёт быть паранойей и становится базовой гигиеной, как мытьё рук.
Чек-лист: что у тебя теперь есть
- Понимание, что случилось с Astra: OpenAI притормозила модель, не исключив критический уровень по кибербезопасности, и это первый такой случай в компании.
- Точное определение критического порога: самостоятельный поиск эксплойтов нулевого дня либо полный цикл новой атаки по одной высокоуровневой цели.
- Список из шести мер, которые OpenAI ввела: изоляция, шифрование весов, мониторинг агентных операций и цепочки рассуждений, остановка части работ, внешняя проверка, изолированное исполнение с инструкциями партнёрам по тестированию.
- Оговорка про мониторинг мыслей: он заявлен для внутренних обучения и оценок, про коммерческую эксплуатацию обещаний нет.
- Хроника инцидентов лета 2026 по OpenAI, Anthropic, Meta и британскому AISI, чтобы отличать реальные события от газетных заголовков, включая поправку про намеренно выданный агентам AISI доступ в сеть.
- Понимание, что строгость лаборатории плавает: в тот же день, когда OpenAI тормозила Astra, Anthropic ослабляла отказы Fable под давлением дешёвых открытых моделей.
- Цифры по России: свыше 160 дипфейков за квартал, рост доли текстовых дипфейк-видео с 17 до 51 процента, 18 млрд рублей ущерба за 2025 год.
- Готовый промпт для проверки подозрительного письма и три рабочих правила защиты.
- Понимание, как получить доступ к моделям OpenAI из России и сколько это стоит в рублях.
Astra это редкий случай, когда компания сама сказала «мы остановились, потому что страшно». Насколько это искренне, покажет дата релиза. А пока полезнее заниматься тем, что уже приходит тебе в мессенджер голосом знакомого человека. Гипотетическая модель в изолированном стенде подождёт.
По материалам TechCrunch: OpenAI says it slowed Astra model development over security concerns, а также публикаций The Next Web, Interesting Engineering и отчёта ЦАСИ за I квартал 2026 года.
Обновление от 10 августа 2026 подготовлено по материалам Digital Trends: OpenAI is pressing pause on its AI model after it displayed dangerous out-of-control tendencies, разбора The Register OpenAI pledges to add Astra security as Anthropic loosens Fable’s leash, а также публикаций CSO Online и Forbes от 10 августа 2026.
Частые вопросы
Что случилось с моделью Astra от OpenAI?
7 августа 2026 OpenAI опубликовала пост, в котором сообщила: предварительные тесты неизданной модели Astra показали настолько сильные результаты в кибербезопасности, что компания не может исключить критический уровень возможностей. Часть внутренних работ над моделью приостановили, а саму разработку перевели в изолированные среды с урезанным доступом к сети.
Что такое критический порог в Preparedness Framework?
Это высшая ступень риска в системе оценки OpenAI, созданной в 2023 году. По кибербезопасности модель попадает на неё, если умеет самостоятельно находить и писать рабочие эксплойты нулевого дня для защищённых реальных систем без человека, либо придумывать и доводить до конца новые сценарии атак на сложные цели, получив только общую формулировку задачи.
Astra уже опасна для обычных пользователей?
Прямо сейчас нет: модель не выпущена, доступа к ней извне нет, она живёт в изолированных стендах OpenAI. Опасность другая и она уже здесь. Инструменты, которые доступны всем, отлично пишут персональный фишинг и подделывают голос, и по данным ЦАСИ за первый квартал 2026 доля дипфейк-видео, собранных простым текстовым запросом, выросла с 17 до 51 процента.
Почему остановка Astra это редкий случай?
Потому что лаборатория сама объявила, что тормозит собственный продукт из-за опасений, хотя рынок требует релизов. Все предыдущие модели OpenAI, включая GPT-5.6-Sol, оставались на ступени High. Astra стала первой, по которой компания публично не смогла исключить критический уровень.
Работает ли ChatGPT из России в августе 2026 и сколько стоит?
Сайт chatgpt.com из России напрямую не открывается, нужен VPN, и вход по российскому номеру телефона обычно не проходит. Подписка Plus стоит 20 долларов в месяц и требует зарубежной карты. Дешевле и проще зайти через российские агрегаторы: MashaGPT берёт 990 рублей в месяц за тариф Base, BotHub стартует примерно от 3 долларов.
Правда ли, что Anthropic в тот же день ослабила ограничения своей модели?
Да. В пятницу 7 августа 2026, в один день с постом OpenAI про Astra, Anthropic сообщила, что делает отказы модели Fable по биологическим запросам реже. В компании их называют fallbacks. Первая версия Fable отказывала так часто, что была почти бесполезна для биологов и специалистов по безопасности. Причина разворота рыночная: китайские лаборатории показали конкурентные модели с открытыми весами дешевле американских.
Мониторинг мыслей Astra будет работать и в коммерческой версии?
Обещания такого нет. OpenAI прямо оговаривает, что сплошной мониторинг цепочки рассуждений относится к внутреннему использованию: обучению и оценкам до релиза. Будет ли он включён при коммерческой эксплуатации, компания не заявляла. Это важное ограничение, которое в пересказах новости обычно теряется.