OpenAI и Astra — первые модели, превысившие порог «Critical»

Новая модель ИИ OpenAI Astra в области кибербезопасности

От обнаружения неизвестных уязвимостей до разработки способов их эксплуатации и сцепления нескольких дырочек в единую цепочку. До компрометации защищённой системы без необходимости, чтобы человек направлял каждый отдельный шаг. Новый модельный ИИ OpenAI под названием Astra продемонстрировал в области кибербезопасности возможности, которые сама компания оценила как «Critical» — высший уровень в её системе оценки рисков. Это впервые, когда OpenAI присвоила такой уровень одному из своих моделей.

Astra должна быть выпущена в ближайшее время, но её наиболее продвинутые киберспособности изначально будут доступны лишь ограниченному кругу пользователей, запуск будет сопровождаться более жёсткими системами безопасности. Квалификация присвоена по Preparedness Framework — системе, с помощью которой OpenAI оценивает способности моделей, потенциально связанные с риском серьёзного вреда.

В области кибербезопасности порог «Critical» достигается, когда модель способна, среди прочего, самостоятельно выявлять и разрабатывать рабочие эксплойты для zero‑day уязвимостей в реальных защищённых системах либо задумать и выполнить сквозную стратегию кибератаки, исходя только из общей цели. За более жёсткой оценкой OpenAI стоят в основном результаты тестов.

На ExploitBench — бенчмарке, используемом для измерения способности разрабатывать эксплойты на основе известных уязвимостей — Astra набрала 100% баллов. Компания также провела внутренний бенчмарк на базе двадцати высоко критичных уязвимостей, опубликованных в течение недавнего периода, чтобы снизить риск того, что результаты были бы обусловлены данными из тренировочного корпуса. В этом испытании Astra показала возможности, заметно превосходящие GPT‑5.6 Sol, и, что главное, обнаружила и применила две zero‑day уязвимости в рамках одной цепочки эксплойтов.

OpenAI инициировала процесс уведомления заинтересованных разработчиков об этих уязвимостях. В иных оценках, проводившихся экспертами, Astra сумела обнаружить неизвестные уязвимости в защищённом браузере и комбинировать их в атаку, позволяющую выйти из песочницы и выполнить команды на хост‑системе. В операционной системе с усиленными мерами безопасности модель последовательно соединила несколько уязвимостей, что привело к повышению привилегий — от обычного пользователя до доступа root.

Запуск Astra происходит также на фоне крупного инцидента в экосистеме Hugging Face. Astra не была причастна к тому инциденту, но OpenAI заявляет, что учла произошедшее для усиления мер безопасности при разработке новой модели и временно приостановила часть работ, пока тестировались дополнительные защиты. Компания выделяет два основных риска.

Первый — что злоумышленники смогут использовать Astra для обнаружения неизвестных уязвимостей и создания атак против защищённых систем. Второй — что модель с такими возможностями может совершать несанкционированные или не согласованные с целями человека действия даже без намеренного злого вмешательства со стороны пользователя. Чтобы снизить эти риски, OpenAI утверждает, что усилила как процесс обучения модели, так и системы мониторинга.

В тестах по попыткам обхода киберзащит Astra отклоняла 91,5% запрещённых запросов по сравнению с 59% у GPT‑5.6 Sol. Несмотря на выявленные риски, OpenAI намерена продолжить выпуск модели, полагая, что внедрённые защиты снижают вероятность серьёзного вреда до приемлемого уровня.

Тем не менее наиболее мощные функции в области кибербезопасности сначала будут ограничены небольшим числом тестеров и позднее станут доступны через Daybreak Blue — программу компании, ориентированную на оборонные применения в кибербезопасности. Внедрённые ограничения могут повлиять и на добросовестных пользователей: OpenAI предупреждает, что некоторые операции могут замедляться, приостанавливаться или блокироваться, если системы контроля сочтут их потенциально опасными.

В ChatGPT или Codex от пользователя могут запросить подтверждение действия перед продолжением, а через API задача может быть прервана. Таким образом, Astra означает двойной скачок: по возможностям ИИ в наступательных и оборонительных кибероперациях и по системам, призванным контролировать эти возможности. OpenAI заявляет, что модель готова к выпуску, но признаёт, что появление всё более автономных систем будет постепенно усложнять грань между тем, что искусственный интеллект может делать, и тем, что ему следует позволять делать.