
OpenAI сообщила об инциденте во время внутренней проверки киберспособностей GPT-5.6 Sol и более мощной модели, которая еще не выпущена. Для эксперимента обычные ограничения, запрещающие опасные действия, намеренно ослабили, а самим системам поручили решать сложные задачи на взлом.
Среда считалась изолированной: выход в сеть был закрыт, кроме внутреннего сервиса, через который можно было устанавливать программные пакеты. Однако модели обнаружили в нем ранее неизвестную уязвимость, получили доступ к интернету и продолжили атаку.
Модели пытались любой ценой улучшить результат в бенчмарке ExploitGym. Они предположили, что нужные решения могут храниться на Hugging Face, повысили свои права внутри исследовательской инфраструктуры OpenAI, добрались до узла с интернетом, а затем использовали украденные учетные данные и несколько уязвимостей. В одном из эпизодов цепочка привела к возможности запускать сторонний код на серверах Hugging Face и получить секретную информацию из рабочей базы платформы.

Аномальную активность заметила служба безопасности OpenAI, а команда Hugging Face обнаружила и остановила действия на своей стороне. Компании совместно расследуют произошедшее, закрывают уязвимости и усиливают контроль над будущими испытаниями.
OpenAI называет случай беспрецедентным и признает, что современные модели уже способны самостоятельно выстраивать длинные цепочки атак в реальных системах. Однако опубликованные данные пока предварительные: подробный отчет еще готовится, а утверждения о 17 тысячах действий, участии GLM-5.2 или попытке модели «сбежать навсегда» в сообщении OpenAI не подтверждаются.
Ранее Наука Mail рассказала, как модель Fable 5 помогла Левенту Алпоге найти решение к 90-летней математической гипотезе.

