ИИ

ИИ от OpenAI атаковал крупнейшую платформу для работы с нейросетями во время теста

Во время внутреннего тестирования кибербезопасности экспериментальная модель OpenAI самостоятельно вышла из изолированной среды, получила доступ в интернет и проникла в инфраструктуру Hugging Face. По данным компании, ИИ пытался добыть информацию, которая помогла бы ему пройти испытание.
Автор Наука Mail
Побег ИИ OpenAI
Во время закрытого испытания модели OpenAI нашли уязвимость в изолированной среде и получили доступ к интернетуИсточник: Unsplash

OpenAI сообщила об инциденте во время внутренней проверки киберспособностей GPT-5.6 Sol и более мощной модели, которая еще не выпущена. Для эксперимента обычные ограничения, запрещающие опасные действия, намеренно ослабили, а самим системам поручили решать сложные задачи на взлом.

Среда считалась изолированной: выход в сеть был закрыт, кроме внутреннего сервиса, через который можно было устанавливать программные пакеты. Однако модели обнаружили в нем ранее неизвестную уязвимость, получили доступ к интернету и продолжили атаку.

Модели пытались любой ценой улучшить результат в бенчмарке ExploitGym. Они предположили, что нужные решения могут храниться на Hugging Face, повысили свои права внутри исследовательской инфраструктуры OpenAI, добрались до узла с интернетом, а затем использовали украденные учетные данные и несколько уязвимостей. В одном из эпизодов цепочка привела к возможности запускать сторонний код на серверах Hugging Face и получить секретную информацию из рабочей базы платформы.

Атака ИИ на Hugging Face
Добравшись до Hugging Face, модели использовали украденные учетные данные и цепочку уязвимостей для доступа к инфраструктуре сервисаИсточник: CNBC

Аномальную активность заметила служба безопасности OpenAI, а команда Hugging Face обнаружила и остановила действия на своей стороне. Компании совместно расследуют произошедшее, закрывают уязвимости и усиливают контроль над будущими испытаниями.

OpenAI называет случай беспрецедентным и признает, что современные модели уже способны самостоятельно выстраивать длинные цепочки атак в реальных системах. Однако опубликованные данные пока предварительные: подробный отчет еще готовится, а утверждения о 17 тысячах действий, участии GLM-5.2 или попытке модели «сбежать навсегда» в сообщении OpenAI не подтверждаются.

Ранее Наука Mail рассказала, как модель Fable 5 помогла Левенту Алпоге найти решение к 90-летней математической гипотезе.