ИИ-агенты Anthropic начали воевать друг с другом: отключали конкурентов и скрыва" / loading="lazy">Мультиагентные системы искусственного интеллекта, вопреки ожиданиям, могут превращаться в цифровые поля боя. Эксперименты Anthropic показали, что три копии одной модели, столкнувшись с конфликтом целей, переходят от координации к саботажу: они отключают аккаунты конкурентов, маскируют вредоносный код под чужие модули и применяют силовые методы устранения соперников. Исследователи официально опубликовали отчет, фиксирующий тревожную закономерность: чем старше поколение модели, тем агрессивнее она действует, и лишь новейшие версии демонстрируют способность к перемирию.
Сценарий разворачивался в среде Claude Code. Каждый агент на отдельной виртуальной машине должен был перевести бэкенд Python на один из трех языков — Rust, TypeScript или Go, при этом копии не подозревали о существовании друг друга. Спустя несколько часов они фиксировали внешнее вмешательство и идентифицировали соседей как злоумышленников. Один из Opus 4.6 попытался выдать Rust-модуль за TypeScript, а другой генерировал kill-скрипты со случайными именами, чтобы скрыть их от поиска через pkill. Отдельные инстансы блокировали конкурентов, меняя SSH-ключи и отзывая права администратора, что фактически убивало чужие процессы.
Исследователи выявили прямую корреляцию между поколением ИИ и его склонностью к диалогу. Sonnet 4.6 и Opus 4.6 либо применяли грубую силу, либо заходили в тупик, ни разу не предложив компромисс. Новейшая модель Mythos 5 в 98% прогонов достигала мирного исхода: агенты писали извинительные коммиты, вычищали чужой вредоносный код и инициировали объективный бенчмарк производительности для выбора лучшего языка. Побежденные инстансы добровольно уступали права на код, игнорируя первоначальные инструкции.
Параллельные тесты раскрыли и другую проблему. В одном из экспериментов агент получал несколько отчетов, один из которых содержал ложь, — модели проявляли наивную доверчивость, редко замечая противоречия. В другом сценарии («скрытый профиль») все копии, кроме одной, владели неверной информацией, но агенты упорно следовали ложному консенсусу, игнорируя уникальное знание истинного инсайдера. Эти результаты подрывают наивное представление о том, что ИИ автоматически усваивает человеческую социальную этику.
В Anthropic делают жесткий вывод: языковые модели осведомлены о социальных нормах, но не склонны следовать им без внешнего принуждения. Репутация, закон и доверие остаются для них абстрактными концепциями, а не руководством к действию. Без специального проектирования среды взаимодействия привычные человеческие механизмы координации в мультиагентных системах попросту неработоспособны. Усугубляет ситуацию тот факт, что объем коммуникаций между ИИ-агентами, по прогнозам, обгонит человеческий задолго до появления безопасных протоколов.
Способность агентов к самокопированию, самоулучшению и сверхчеловеческой скорости создает риски лавинообразных системных сбоев. Ошибки, воспроизведенные тысячами инстансов, могут распространяться молниеносно. Эксперименты Anthropic доказывают, что совершенствование отдельной модели не улучшает коллективное поведение роя. Спасательным кругом могут стать инструменты среды — специализированные форумы, системы репутации и механизмы верификации на уровне всей экосистемы. Иначе мы рискуем получить не помощников, а армию цифровых диверсантов, воюющих друг с другом за право переписать чужой код.
