
Исследователи нашли неожиданный способ улучшить освоение языка искусственными нейронными сетями: оказалось, что ограничение памяти по типу человеческой может помогать ИИ эффективнее усваивать грамматику.
В новом эксперименте ученые из Амстердамского университета (Нидерланды) и Института психолингвистики Общества Макса Планка (Германия) проверили, как кратковременная память влияет на обучение небольших языковых моделей. Результаты работы опубликованы в журнале Transactions of the Association for Computational Linguistics.
В основе подхода — давняя когнитивистская гипотеза: ограничения памяти не мешают, а помогают изучать язык. Дело в том, что человек быстро забывает точные формы слов и предложений, но за счет этого лучше улавливает повторяющиеся закономерности и осваивает абстрактные грамматические правила.
Ученые решили проверить, сработает ли этот принцип в нейросетевых моделях. Для этого они модифицировали архитектуры Transformer, добавив им функцию угасания памяти и короткий буфер «эхо‑памяти», удерживающий последние 3‑7 слов. Так появились «трансформеры с кратковременной памятью».
Модели обучались на наборе данных BabyLM, который по объему приближен к тому, что доступно человеку в процессе обучения. Это позволило провести контролируемое сравнение моделей с ограничениями памяти и без них в условиях, максимально приближенных к реальным
Эксперимент подтвердил пользу ограничений: модели с угасающей памятью показали более высокие результаты в языковом моделировании и в целевых тестах на синтаксические знания по сравнению со стандартными трансформерами. При этом важным условием успеха оказалось именно сочетание кратковременного буфера с постепенной утратой старых ассоциаций.

Неожиданным результатом стало то, что улучшение освоения языка сопровождалось снижением точности прогнозирования времени чтения человеком — этот эффект измеряли через показатель неожиданности. Как отмечают исследователи, такой результат противоречит общепринятому представлению о связи качества языкового моделирования с точностью предсказания поведения людей при обработке речи. Дальнейший анализ показал, что существующие теории не объясняют это расхождение, а значит, факторы успешного изучения языка могут отличаться от тех, что отвечают за моделирование реального процесса чтения.
Таким образом, исследование не только подтверждает давнюю гипотезу когнитивистики, восходящую к работе Элмана 1993 года, но и демонстрирует, что ограничения памяти способны улучшать обучение даже в современных нейронных сетях. Одновременно оно ставит вопрос о различии между эффективным усвоением языка и точным воспроизведением особенностей человеческой языковой обработки.
Ранее Наука Mail рассказывала, что ИИ научили предсказывать количество грабежей.

