
Исследователи Сколтеха и Центра практического искусственного интеллекта Сбербанка разработали метод TOHA для обнаружения галлюцинаций больших языковых моделей в RAG-системах — ИИ-приложениях, которые перед генерацией ответа обращаются к внешним базам знаний или документам, сообщили в пресс-службе Сколтеха.
Даже при подключении внешнего контекста языковые модели способны генерировать правдоподобные ответы, которые не вытекают из предоставленной информации. Существующие детекторы галлюцинаций либо требуют большого объема размеченных данных, либо многократно запускают модель для сравнения результатов, что дорого по вычислительным ресурсам.
TOHA (TOpology-based HAllucination detector) использует принципиально иной подход: авторы преобразуют матрицы внимания модели в графы и вычисляют для них топологическую характеристику MTop-Div, отражающую различия между структурой подграфов, соответствующих исходному контексту и сгенерированному ответу.

Оказалось, что у отдельных «голов» механизма внимания высокие значения этой топологической дивергенции устойчиво указывают на ответы, не подтвержденные контекстом.
В этой работе мы показываем, что такой сигнал можно извлечь из внутреннего описания текста моделью, если правильно на него посмотреть. Активация специальных топологических признаков сигнализирует о потенциальных галлюцинациях, не требуя обучения дополнительной модели-детектора и многократной генерации ответов
Для настройки метода достаточно небольшого набора размеченных примеров — обучать отдельный классификатор не нужно. По результатам тестирования на задачах ответов на вопросы и суммаризации TOHA показал результаты на уровне или выше современных аналогов при значительно меньших затратах по сравнению, в частности, с методом SelfCheckGPT.
Практическая реализация TOHA уже включена в открытую библиотеку SIRIN, разработанную Центром практического ИИ Сбербанка для выявления контекстных несоответствий в системах на базе больших языковых моделей.
По словам старшего управляющего директора и директора по AI-трансформации Сбербанка Сергея Рябова, технология делает доступной надежную проверку ответов ИИ без масштабной разметки данных. Особую ценность инструмент представляет для отраслей, где ошибки ИИ-систем несут финансовые, юридические или репутационные риски, — банков, страховых компаний и юридических сервисов.
Работа принята и опубликована на конференции Association for Computational Linguistics — ACL 2026, имеющей рейтинг A*.
Ранее Наука Mail рассказывала о других алгоритмах проверки ИИ-систем на галлюцинации, разработанных специалистами Московского государственного психолого-педагогического университета.

