Выявлена слабая сторона ИИ по сравнению с человеком

Современные нейросети демонстрируют впечатляющие возможности в написании текстов и решении задач, но пасуют перед банальной потерей концентрации. Базовый психологический тест на внимательность обнажил фундаментальные отличия искусственного интеллекта от человеческого разума.
Автор Наука Mail
Тес Струпа для ИИ
В классическом варианте этого теста названия цветов печатаются чернилами несовпадающего оттенка — например, слово «красный» пишется синим цветомИсточник: Unsplash

Группа независимых исследователей протестировала передовые языковые модели с помощью классического психологического эксперимента. Статья опубликована в журнале PNAS Nexus.

Исследователи адаптировали для нейросетей задачу Струпа. В классическом варианте этого теста названия цветов печатаются чернилами несовпадающего оттенка, например, слово «красный» пишется синим цветом. Испытуемый должен назвать цвет шрифта, подавив автоматическую привычку читать само слово. В психологии этот тест оценивает исполнительный контроль: способность концентрироваться на задаче и сопротивляться отвлекающим факторам.

При тестировании популярных систем искусственного интеллекта, таких как GPT-4o, Claude 3.5 Sonnet и Gemini 2.5, выявилась четкая закономерность. Нейросети легко справлялись с короткими списками из пяти слов — точность ответов превышала 90%.

Разноцветные буквы
По мере увеличения объема задачи результаты систем катастрофически ухудшалисьИсточник: Unsplash

По мере увеличения объема задачи результаты систем катастрофически ухудшались. На списке из 40 слов точность модели GPT-4o упала до 15%. Модель Claude 3.5 Sonnet сохраняла стабильность на 20 словах, но при расширении списка рухнула до отметки в 24%.

Машины не смогли долго удерживать в «памяти» исходную инструкцию и переключились на чтение самих слов. Человеческий мозг, несмотря на аналогичную склонность к автоматическому чтению, способен усилием воли сохранять фокус даже при длинных последовательностях. Результаты указывают на фундаментальные ограничения архитектуры современных языковых моделей при работе с длительными и конфликтующими инструкциями.

Ранее Наука Mail рассказывала, что ИИ, по всей видимости, не повышает производительность.