Модель Grok 4.5 от xAI (SpaceXAI) возглавила рейтинг Long-Horizon Terminal-Bench, показав средний результат 0,505 и решив 13 из 46 сложных задач.
В мире больших языковых моделей наступил тот редкий момент, когда цифры в бенчмарках начинают говорить громче маркетинговых слоганов. Свежий рейтинг Long-Horizon Terminal-Bench за июль 2026 года расставил точки над i: Grok 4.5 от SpaceXAI (бывшая xAI) официально взобрался на вершину, оставив позади не только своих прямых конкурентов, но и собственное довольно блеклое прошлое. Илон Маск, как водится, не преминул оповестить мир о триумфе, однако за его постом скрывается куда более интересная техническая драма, чем просто очередной «релиз номер один».
Для тех, кто не в курсе: Long-Horizon Terminal-Bench — это не очередной набор тестов на эрудицию, где можно нагуглить ответ в тренировочных данных. Это цифровой ад для ИИ-агентов, погруженных в среду командной строки. Здесь нет подсказок и визуальных интерфейсов — только голый терминал, поток текста и необходимость выстраивать многоступенчатые логические цепочки. Модель должна не просто генерировать связный текст, а принимать решения, анализировать меняющийся вывод консоли и адаптировать план действий на лету. Считайте это тестом на выживание для цифрового разума, где каждая ошибка на промежуточном этапе обнуляет всю предыдущую работу.
И вот сухие, но красноречивые цифры: средний показатель Grok 4.5 остановился на отметке 0.505, и он смог одолеть 13 из 46 крайне сложных заданий. На первый взгляд, результат может показаться скромным — ведь это даже не половина кейсов. Но вся соль в контексте. Предыдущая инкарнация, Grok 4.20, на том же самом полигоне не решила ровным счетом ничего. Абсолютный ноль. Этот скачок от полной беспомощности до решения более четверти задач говорит о тектоническом сдвиге в архитектуре или методологии обучения. Причем обошёл он не абы кого, а крепких середняков и лидеров вроде Claude Sonnet 5, Opus 4.8 и даже GPT-5.5, которые тоже вкладывают бешеные ресурсы в агентные сценарии.
Стоит понимать, что победа в Terminal-Bench — это не про написание стихов или генерацию кода для «Hello World». Это прямой бинокль в будущее, где ИИ будет управлять серверами, администрировать системы и проводить сложный финансовый анализ без участия человека. Маск давно говорит, что Grok 4.5 затачивался под специфические вертикали: юридическую обработку документов и финансовые потоки. Именно в этих сферах способность удерживать длинный контекст и просчитывать действия на много шагов вперед превращается из академического интереса в миллиардные выгоды.
Прогресс между версиями 4.20 и 4.5 демонстрирует не просто удачную настройку гиперпараметров, а качественную эволюцию в подходах к обучению агентов. Мы видим, как индустрия окончательно смещается от гонки гигафлопов к гонке архитектурной эффективности. Успех Grok показывает: чтобы решать сложные задачи в замкнутых средах, недостаточно просто увеличить объем данных — нужно менять саму логику принятия решений. И если текущий темп xAI (теперь уже под крылом SpaceX) сохранится, то разрыв между «просто болталкой» и «полноценным агентом» будет сокращаться с каждой новой итерацией, приближая нас к той самой сингулярности, о которой так любят рассуждать в Кремниевой долине.
Читайте также:




1 комментарий для “Grok 4.5 стал лучшим ИИ в бенчмарке Long-Horizon Terminal-Bench”