
Группа независимых исследователей протестировала передовые языковые модели с помощью классического психологического эксперимента. Статья опубликована в журнале PNAS Nexus.
Исследователи адаптировали для нейросетей задачу Струпа. В классическом варианте этого теста названия цветов печатаются чернилами несовпадающего оттенка, например, слово «красный» пишется синим цветом. Испытуемый должен назвать цвет шрифта, подавив автоматическую привычку читать само слово. В психологии этот тест оценивает исполнительный контроль: способность концентрироваться на задаче и сопротивляться отвлекающим факторам.
При тестировании популярных систем искусственного интеллекта, таких как GPT-4o, Claude 3.5 Sonnet и Gemini 2.5, выявилась четкая закономерность. Нейросети легко справлялись с короткими списками из пяти слов — точность ответов превышала 90%.

По мере увеличения объема задачи результаты систем катастрофически ухудшались. На списке из 40 слов точность модели GPT-4o упала до 15%. Модель Claude 3.5 Sonnet сохраняла стабильность на 20 словах, но при расширении списка рухнула до отметки в 24%.
Машины не смогли долго удерживать в «памяти» исходную инструкцию и переключились на чтение самих слов. Человеческий мозг, несмотря на аналогичную склонность к автоматическому чтению, способен усилием воли сохранять фокус даже при длинных последовательностях. Результаты указывают на фундаментальные ограничения архитектуры современных языковых моделей при работе с длительными и конфликтующими инструкциями.
Ранее Наука Mail рассказывала, что ИИ, по всей видимости, не повышает производительность.
