В мире искусственного интеллекта разгорается новая битва, и на этот раз поле сражения — медицина. Илон Маск, как всегда, не упустил возможности громко заявить о триумфе своего детища: модель Grok 4.6 от xAI заняла первую строчку в специализированном тесте MedAgentBench, оставив позади такого серьезного конкурента, как GPT-5.6 Sol от OpenAI. Результаты, обнародованные 17 августа, заставляют по-новому взглянуть на амбиции Маска в столь чувствительной и сложной области.
В отличие от стандартных бенчмарков, которые проверяют лишь эрудицию нейросети, MedAgentBench моделирует реальную работу с электронными медицинскими картами. Системе недостаточно просто дать правильный ответ — ИИ должен самостоятельно ориентироваться в 300 клинических сценариях и успешно справляться с заданиями десяти различных типов, демонстрируя навыки настоящего ассистента врача. Это принципиально иной уровень сложности, где ценятся не общие знания, а способность принимать решения в условиях ограниченной информации.
По итогам оценки Grok 4.6 показал 95,9% точности с первой попытки, буквально на пару процентных пунктов обойдя модель GPT-5.6 Sol с её 94,7%. Особого внимания заслуживает прогресс внутри самого семейства Grok: по сравнению с версией 4.5, новая итерация прибавила 2,5 процентных пункта, что подтверждает системную работу команды над улучшением качества. При этом инженеры xAI подчеркивают стабильность результатов при многократных прогонах — важный фактор для любой системы, претендующей на применение в здравоохранении, где цена ошибки особенно высока.
Интересно, что OpenAI, судя по всему, в последнее время сосредоточилась на развитии мультимодальных возможностей GPT-5.6 Sol, уделяя меньше внимания узкоспециализированным медицинским тестам. Это позволило Grok вырваться вперед именно в этой нише. Но нужно понимать: MedAgentBench — это всего лишь симуляция, и до реальной работы в клиниках пока далеко. Однако победа в этом тесте — это мощный сигнал рынку: большие языковые модели всё увереннее входят в клиническую практику.
Пока одни разработчики соревнуются в общих тестах на логику и креативность, Маск делает ставку на узкоспециализированные задачи с высоким порогом ответственности. Если Grok 4.6 сможет подтвердить свои показатели в реальных больничных условиях, это станет не просто маркетинговым достижением, а реальным шагом к внедрению ИИ в систему здравоохранения. Вопрос только в том, насколько быстро регуляторы и врачи доверят таким системам работу с пациентами. Одно ясно точно: битва за искусственный интеллект выходит на новый уровень — теперь счет идет не на проценты точности, а на спасенные жизни.
