Модель Grok 4.5 от xAI (SpaceXAI) возглавила рейтинг Long-Horizon Terminal-Bench, показав средний результат 0,505 и решив 13 из 46 сложных задач.
Grok 4.5 стал лучшим ИИ в бенчмарке Long-Horizon Terminal-Bench
Илон Маск сообщил, что языковая модель Grok 4.5 заняла первое место в рейтинге Long-Horizon Terminal-Bench по итогам июля 2026 года. Этот бенчмарк специально создан для тестирования ИИ-агентов. Он проверяет способность решать сложные задачи, требующие многоэтапного планирования и анализа. Модели работают в среде командной строки.
Результаты Grok 4.5
Grok 4.5 показал средний результат 0,505. Он успешно справился с 13 из 46 тестовых заданий. Особенно заметен прогресс по сравнению с предыдущей версией Grok 4.20. Та не смогла решить ни одного задания в этом бенчмарке. Новая модель обошла Claude Sonnet 5, Opus 4.8, Fable 5, GPT-5.5 и другие ведущие системы.
Что такое Long-Horizon Terminal-Bench
Это специализированный тест для ИИ-агентов. Он оценивает их способность выполнять длительные и сложные последовательности действий. Модели должны принимать решения, анализировать данные и адаптироваться к меняющимся условиям. Бенчмарк считается одним из самых сложных в отрасли.
Значение достижения
Победа Grok 4.5 подтверждает прогресс компании xAI (теперь SpaceXAI). Илон Маск делает ставку на создание мощных моделей, способных конкурировать с лидерами рынка. Grok 4.5 специализируется на агентном программировании, работе с финансами и юриспруденцией. Он также хорошо справляется с обработкой документов.
- Средний результат – 0,505;
- Решено 13 из 46 заданий;
- Обогнал Claude Sonnet 5 и GPT-5.5;
- Предыдущая версия не решила ни одной задачи.
Разрыв между версиями показывает быстрый прогресс в развитии моделей. Это также говорит о том, что конкуренция в сфере ИИ продолжает обостряться. Каждый новый релиз приближает нас к созданию более автономных и умных систем.