Языковые модели не справились с тестом на синтаксический анализ: неожиданные итоги

Обширное исследование с участием 368 участников и 409 оценок от нейросетей показало, что прогнозирование следующего токена не отражает работу мозга при исправлении ошибок в сложных предложениях

Искусственный интеллект022 минуты назад

Исследователи из Нью-Йоркского университета (New York University) и Университета Массачусетса в Амхерсте (University of Massachusetts Amherst) выяснили, что известная метрика вероятности следующего токена в языковых нейросетях не способна адекватно отразить то, как человеческий мозг справляется с ошибками понимания во время чтения. В исследовании, опубликованном в журнале Национальной академии наук США (Proceedings of the National Academy of Sciences, PNAS), были сопоставлены движения глаз 368 взрослых читателей с 409 оценками вероятности слов, полученными от различных языковых моделей.

Эксперимент продемонстрировал, что простой принцип предсказания следующего слова описывает лишь первичное беглое чтение, но полностью игнорирует процессы синтаксического переанализа и возвратные движения глаз, которые выполняет человек при столкновении со сложными фразами.

Для проверки когнитивной точности нейросетей ученые применили метод отслеживания глаз (eye-tracking) и разделили процесс чтения на 4 анализируемых параметра: время первого прямого прохода по слову, факт совершения регрессии (возвратного движения взгляда к ранее прочитанным словам), время до совершения регрессии и общее время повторного чтения.

Участникам было предложено читать контролируемые предложения с синтаксической неоднозначностью — предложения «гарден-пат» (garden-path — фразы, где начальная структура сбивает читателя с толку и заставляет переосмыслить смысл ближе к концу). Во всех протестированных моделях математический показатель «сюрпризал» (surprisal — мера того, насколько слово неожиданно для алгоритма на основе предыдущего текста) хорошо совпал с замедлением читателя при первом проходе, но существенно недооценил временные затраты на повторный разбор структуры.

Изображение сгенерировано: Nano Banana

Результаты эксперимента подтверждают многоуровневую гипотезу человеческого чтения. Прогнозирование следующего слова способствует распознаванию знакомых понятий и быстрой интеграции смыслов при простом тексте, но оказывается непригодным для описания механизмов выявления ошибок и реструктуризации предложений. Когда первоначальная интерпретация текста разрушается, человек сознательно возвращает взгляд к определённым ключевым словам для исправления логики, в то время как «статистический сюрпризал» нейросетей оценивает лишь линейную вероятность токенов без учета построения и пересчёта иерархических грамматических связей.

Авторы подчеркивают, что данная работа не ставит целью обесценить языковые модели как инструмент, но указывает на явные ограничения их применения в когнитивных науках. Вероятность следующего токена больше не может служить единственным и полным эквивалентом сложности текста для человеческого восприятия.

Для разработчиков, создающих системы оценки понятности интерфейсов или вспомогательные инструменты для людей с нарушениями чтения, использование классической авторегрессионной вероятности оказывается недостаточным. Будущие сервисы оценки сложности текста должны включать явные механизмы структурного анализа, регистрации и подсчета ошибок и «синтаксического ремонта».

Darth SaharaИсточники:PNASИскусственный интеллект0Искусственный интеллектНейросетиЯзыковые моделиКогнитивные наукиPNASПсихолингвистика22 минуты назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов