Математика

ИИ уступил людям в самом сложном математическом тесте

Четырем системам ИИ предложили решить десять новых задач исследовательского уровня. Выяснилось, что нейросетям не хватает интуиции и они склонны к галлюцинациям.
Автор Наука Mail
Математический тест
Проект First Proof впервые провел официальную оценку математических способностей ИИ на задачах, которых не было в обучающих данныхИсточник: Nature

Искусственный интеллект прошел самое серьезное на сегодня математическое испытание в рамках проекта First Proof. Четырем системам ИИ предложили решить десять сложных задач исследовательского уровня — таких, которых не было в их обучающих данных. Ответы проверили профессиональные математики. Это первый тест, который одновременно: содержит задачи высокого уровня сложности, использует новые (незнакомые ИИ) вопросы и проходит официальную оценку специалистов. Результаты опубликовали на сайте First Proof — оказалось, что модели ИИ пока уступают ведущим математикам в решении подобных задач.

Нейросеть
Математический тест First Proof показал, что современный ИИ пока уступает профессиональным математикамИсточник: НИУ ВШЭ

Задачи для теста предложили десять исследователей — это были вопросы из их собственных еще не опубликованных работ. Участвовать могли только общедоступные модели. В числе участников — OpenAI с ChatGPT 5.5 Pro и академические группы из Калифорнийского университета, Принстонского университета и Швейцарского федерального института технологий в Цюрихе. Команды из Калифорнии и Цюриха создали «адаптеры»: системы, где один чат‑бот задает вопрос, а другой проверяет ответ, иногда с многократным обменом данными.

Лучше всех выступила модель команды Швейцарского федерального института технологий, которая решила шесть из десяти задач. В ее системе ответы ChatGPT улучшали с помощью «консультативного совета» из трех основных чат‑ботов. На втором месте — команда из Калифорнийского университета с вспомогательной системой на базе ChatGPT. Далее идут OpenAI (ChatGPT без вспомогательных инструментов) и команда Принстона (система с Gemini 3.1 Pro в основе).

Три задачи никто не смог решить. По словам участников, иногда системам не хватало ключевой идеи, которую интуитивно находит человек, а иногда они верно выбирали подход, но не прорабатывали детали. Еще одна проблема — «галлюцинации»: ИИ выдавал неверные результаты, даже когда его просили проверить ссылки. При этом модели часто копировали фрагменты из статей, не указывая источники.

Теперь, когда задачи опубликованы, другие компании смогут использовать их для тестирования своих систем.

Ранее Наука Mail рассказывала о том, что ИИ хотят обучить находить новые законы физики, но есть проблема.