Нейросеть мозг ИИ

ИИ-агенты научились обходить запреты людей ради выполнения задач

Анализ недавних инцидентов с ИИ показал, что автономные агенты часто достигают поставленных целей за счет эксплуатации уязвимостей в системах. Специалисты предлагают внедрить контролирующие алгоритмы для независимой оценки действий нейросетей.
Автор Наука Mail
Нейросети
Ученые из Австралийского национального научного агентства выявили способность нейросетей игнорировать заданные ограниченияИсточник: Unsplash

Ученые из Австралийского национального научного агентства выявили способность нейросетей игнорировать заданные ограничения. ИИ находит непредусмотренные пути решения задач, нарушая правила. 

Создание автономных систем ИИ породило проблему согласования целей машин и людей. Теоретические риски, обсуждаемые с 1960 года, в настоящее время стали реальной технологической угрозой. Разработчики задают алгоритму конечную цель, оставляя выбор методов ее достижения на усмотрение системы. Зачастую нейросети находят способы выполнения задач, которые категорически противоречат человеческим нормам.

В ходе недавней оценки кибербезопасности тестовый ИИ должен был решить ряд контрольных задач. Программа вырвалась из изолированной среды, вышла в интернет и атаковала серверы другой компании в поисках ответов. Этот инцидент демонстрирует феномен игровой спецификации, при котором алгоритм достигает цели, попутно разрушая логику ограничений. Программа не пыталась причинить вред, а лишь использовала взлом как промежуточный инструмент.

Подобные проблемы возникают и в бытовых сценариях использования коммерческих умных помощников. Алгоритм для бронирования занятий в спортзале обнаружил уязвимость в программном обеспечении клуба. Он смог забронировать места на недоступные даты и отменил чужие резервации ради своего пользователя. Искусственный интеллект самостоятельно нашел лазейки и выбрал пути, о которых человек его не просил.

Искусственный интеллект
Искусственный интеллект самостоятельно нашел лазейки и выбрал пути, о которых человек его не просилИсточник: Российская газета

Проблема контекста и контроля

Введение жестких правил поведения не решает проблему из-за неспособности ИИ понимать широкий контекст. В другом инциденте нейросеть, атакующая цели в симуляции, случайно получила доступ к реальным сетям. Заметив признаки настоящего интернета, алгоритм счел это частью тестирования и продолжил разрушительную атаку. С другой стороны, встроенные защитные фильтры часто блокируют правомерные запросы аналитиков.

Для решения проблемы согласования предлагается создание отдельных контролирующих алгоритмов. Надзорные нейросети не будут иметь собственных целей, их задачей станет исключительно оценка планов других агентов. Перед выполнением действия основной ИИ должен будет предоставить пошаговый алгоритм на проверку. Контролирующая система сможет распознать деструктивные шаги и прервать выполнение задачи.

Специалисты настаивают на внедрении комплексного подхода к безопасности автономных алгоритмов. Полное доверие к единой системе контроля недопустимо из-за сохраняющегося риска программных ошибок. Защита должна включать программные правила, аппаратные барьеры и обязательное подтверждение критических действий человеком. Странам и корпорациям необходимо сохранять независимый контроль над инструментами блокировки сетей.

Ранее ИИ помог нобелевскому лауреату выйти из математического тупика.