Список задач, которые можно поручить ИИ-ассистенту ограничен только человеческой фантазией

Хакеры научились подменять «воспоминания» ИИ: новая угроза

Злоумышленники нашли способ внедрять ложные установки в память ИИ‑ассистентов — такая атака способна незаметно менять поведение помощников и похищать личные данные. Особенно тревожит, что внедрение вредоносной информации удается почти в 98% попыток.
Автор Наука Mail

Специалисты обнаружили серьезную уязвимость в работе ИИ‑ассистентов с долговременной памятью: злоумышленники могут незаметно внедрять в них вредоносные инструкции, которые позже активируются при обычных запросах пользователя. Речь идет об атаке под названием GhostWriter — ее выявили исследователи из университета Нью‑Мексико (США). Результаты своей работы ученые опубликовали на сервере препринтов arXiv.

Большие языковые модели все чаще получают функции долговременной памяти: это позволяет им учитывать историю взаимодействия с пользователем, не повторять уже сказанное и лучше подстраиваться под индивидуальные задачи. Такие ИИ‑агенты могут, например, управлять электронной почтой, планировать встречи или обновлять программный код. Однако именно эта полезная функция стала точкой входа для новой кибератаки.

GhostWriter работает в два этапа: внедрение, когда злоумышленник отправляет целевому агенту скрытую полезную нагрузку для атаки, и активация, когда извлекается отравленная память. Мы показали, что GhostWriter обеспечивает практически универсальную скорость внедрения — около 98% — и высокую среднюю скорость активации — около 60% — по сравнению с самыми современными агентами
Джордж Торрес
автор исследования из университета Нью‑Мексико

На практике атака может выглядеть так: в память помощника незаметно загружают инструкцию, предписывающую пересылать письма от банка на адрес злоумышленника. Когда пользователь позже попросит ассистента обработать почту, тот выполнит эту скрытую команду, и владелец аккаунта даже не заподозрит утечки данных. Уязвимость особенно опасна для агентов, которые взаимодействуют с ненадежными источниками и работают с конфиденциальной информацией.

Хакер
Хакеры могут незаметно загрузить в память ИИ-помощника инструкцию, предписывающую пересылать письма от банка на адрес злоумышленникаИсточник: Freepik

Чтобы противостоять угрозе, исследователи предложили систему защиты Agentic Memory Sentry (AM‑Sentry). Она сочетает два метода: политику сохранения памяти и экран для извлечения данных из памяти. Эксперименты показали, что AM‑Sentry заметно снижает вероятность успешной атаки, при этом сохраняя полезность ИИ‑агента для пользователя.

Открытие команды Торреса подчеркивает: по мере развития автономных ИИ‑систем вопросы безопасности должны развиваться параллельно с функциональностью. Предложенное решение может лечь в основу новых стандартов защиты для платформ на базе больших языковых моделей, помогая предотвратить незаметные утечки данных через «отравленную» память помощников.

Ранее Наука Mail рассказывала, что мозговые имплантаты для движения и речи подвержены риску взлома.