Обширное исследование с участием 368 участников и 409 оценок от нейросетей показало, что прогнозирование следующего токена не отражает работу мозга при исправлении ошибок в сложных предложениях
Искусственный интеллект022 минуты назад
Исследователи из Нью-Йоркского университета (New York University) и Университета Массачусетса в Амхерсте (University of Massachusetts Amherst) выяснили, что известная метрика вероятности следующего токена в языковых нейросетях не способна адекватно отразить то, как человеческий мозг справляется с ошибками понимания во время чтения. В исследовании, опубликованном в журнале Национальной академии наук США (Proceedings of the National Academy of Sciences, PNAS), были сопоставлены движения глаз 368 взрослых читателей с 409 оценками вероятности слов, полученными от различных языковых моделей.
Эксперимент продемонстрировал, что простой принцип предсказания следующего слова описывает лишь первичное беглое чтение, но полностью игнорирует процессы синтаксического переанализа и возвратные движения глаз, которые выполняет человек при столкновении со сложными фразами.
Для проверки когнитивной точности нейросетей ученые применили метод отслеживания глаз (eye-tracking) и разделили процесс чтения на 4 анализируемых параметра: время первого прямого прохода по слову, факт совершения регрессии (возвратного движения взгляда к ранее прочитанным словам), время до совершения регрессии и общее время повторного чтения.
Участникам было предложено читать контролируемые предложения с синтаксической неоднозначностью — предложения «гарден-пат» (garden-path — фразы, где начальная структура сбивает читателя с толку и заставляет переосмыслить смысл ближе к концу). Во всех протестированных моделях математический показатель «сюрпризал» (surprisal — мера того, насколько слово неожиданно для алгоритма на основе предыдущего текста) хорошо совпал с замедлением читателя при первом проходе, но существенно недооценил временные затраты на повторный разбор структуры.

Результаты эксперимента подтверждают многоуровневую гипотезу человеческого чтения. Прогнозирование следующего слова способствует распознаванию знакомых понятий и быстрой интеграции смыслов при простом тексте, но оказывается непригодным для описания механизмов выявления ошибок и реструктуризации предложений. Когда первоначальная интерпретация текста разрушается, человек сознательно возвращает взгляд к определённым ключевым словам для исправления логики, в то время как «статистический сюрпризал» нейросетей оценивает лишь линейную вероятность токенов без учета построения и пересчёта иерархических грамматических связей.
Авторы подчеркивают, что данная работа не ставит целью обесценить языковые модели как инструмент, но указывает на явные ограничения их применения в когнитивных науках. Вероятность следующего токена больше не может служить единственным и полным эквивалентом сложности текста для человеческого восприятия.
Для разработчиков, создающих системы оценки понятности интерфейсов или вспомогательные инструменты для людей с нарушениями чтения, использование классической авторегрессионной вероятности оказывается недостаточным. Будущие сервисы оценки сложности текста должны включать явные механизмы структурного анализа, регистрации и подсчета ошибок и «синтаксического ремонта».
Darth SaharaИсточники:PNASИскусственный интеллект0Искусственный интеллектНейросетиЯзыковые моделиКогнитивные наукиPNASПсихолингвистика22 минуты назад
Источник