
Исследователи из Университета Ватерлоо и некоммерческой организации FAR.AI протестировали 21 ведущую модель ИИ, которую может скачать и использовать любой желающий, и выяснили, что все они поддаются взлому — защитные механизмы, которые должны предотвращать вредное использование, можно легко обойти. Это значит, что такие модели могут быть перепрограммированы для создания фейковых новостей, мошеннических писем или даже инструкций по изготовлению опасных веществ.
Подобные модели, называемые большими языковыми моделями (LLM), умеют писать тексты, отвечать на вопросы и писать код. В отличие от закрытых систем вроде ChatGPT, открытые модели доступны всем — от отдельных программистов до больниц и государственных учреждений. Именно их открытость позволяет глубоко изучать и проверять работу ИИ, но одновременно создает риски.

Убрав защиту, можно заставить модель работать на массовое вредительство — например, генерировать тысячи персонализированных писем-мошенничеств за считанные минуты. При этом современные открытые модели уже почти не уступают самым мощным закрытым по качеству ответов, а значит, и потенциальный вред от их злоупотребления растет.
Исследователи подчеркивают: это не повод отказываться от открытых моделей. Напротив, их прозрачность помогает следить за тем, как ИИ работает и не причиняет ли вред, однако сейчас системы защиты не справляются со своей задачей. Чтобы оценить угрозы, команда создала инструмент под названием TamperBench, который помогает проверять, насколько легко взломать ту или иную модель.
Ранее Наука Mail рассказывала о том, что разработан эффективный метод оценки неуверенности ИИ.

