
Исследователи из Нью-Йоркского университета и Университета Массачусетса в Амхерсте опубликовали в PNAS работу, которая ставит под сомнение универсальность ключевой метрики языковых моделей — вероятности следующего токена. Эксперименты с айтрекингом показали, что этот статистический показатель хорошо описывает только первичное беглое чтение, но полностью игнорирует сложные когнитивные процессы, которые человек запускает при столкновении с синтаксически неоднозначными фразами.
В исследовании участвовали 368 взрослых читателей, чьи движения глаз сравнивали с 409 оценками «сюрпризала» (surprisal) от различных языковых моделей. Участникам предъявляли предложения типа «гарден-пат» — конструкции, где начальная структура вводит в заблуждение, и смысл раскрывается только в конце, заставляя мозг пересматривать прочитанное. Айтрекинг фиксировал четыре параметра: время первого прохода по слову, факт возвратного движения взгляда (регрессии), время до регрессии и суммарное время повторного чтения.
Оказалос�, что сюрпризал — мера неожиданности слова для алгоритма — отлично коррелирует с замедлением при первом чтении, но катастрофически недооценивает затраты на повторный синтаксический разбор. Когда первоначальная интерпретация рушится, человек осознанно возвращается к ключевым словам и перестраивает грамматическую структуру. Нейросеть же оценивает лишь линейную вероятность токенов, не строя и не пересчитывая иерархические связи между частями предложения.
Эксперимент подтверждает многостадийную гипотезу чтения: первичное распознавание слов и интеграция смысла работают на предсказании, но обнаружение ошибок и «синтаксический ремонт» требуют совершенно иных механизмов. По сути, человеческий мозг действует как синтаксический парсер с обратной связью, а языковая модель — как гладкий статистический автомат, который не умеет откатываться назад по логической структуре.
Авторы подчёркивают: работа не обесценивает языковые модели, но указывает на границы их применения в когнитивных науках. Вероятность следующего токена больше не может служить универсальным эквивалентом сложности текста для человека. Это особенно важно для разработчиков систем оценки читаемости интерфейсов или вспомогательных инструментов для людей с дислексией — авторегрессионные метрики дают ложное чувство точности.
Главный вывод исследования: будущие сервисы анализа текста должны включать явные механизмы структурного анализа, регистрации ошибок и синтаксического восстановления. Без этого модели будут продолжать делать вид, что понимают текст, в то время как человек будет спотыкаться о те же конструкции, которые нейросеть считает «простыми». Это не просто академический спор, а вопрос практический: от качества оценки сложности текста зависит, насколько комфортно пользователи будут воспринимать инструкции, контракты или учебные материалы. И если мы не перестанем полагаться на упрощённые метрики, мы рискуем строить интерфейсы, удобные для машин, но не для людей.
