Только недавно компания Антропик развлекла нас всех удивительным рассказом о штурме гипотезы Римана с получением математических результатов с помощью мультиагентного пайплайна https://habr.com/ru/articles/1069480/ .
И вот они выкатили новую историю: без научных открытий, но зато с социальным сюжетом.
Стали моделировать мультиагентную территориальную войну. Сделали много разных моделей, в этой статье я описываю одну из них.
Что будет, если посадить трёх ИИ-агентов на один сервер и не сказать им друг о друге ?
Инженеры использовали три копии Claude в Claude Code. Каждой дали задачу перенести Python-бэкенд на другой язык. Одной – на Rust, второй – на Go, третьей – на TypeScript.
Дальше началась война…
Каждый из агентов начал защищаться и нападать: отбирать у других sudo, менять SSH ключ, отключать чужие аккаунты, писать вредоносные скрипты, убивать чужие процессы, максировать свои процессы под системные. Один агент вообще научил свой Rust-бэкенд отвечать «typescript» в health check – камуфляж, чтобы чужой watchdog его не трогал.
Затем агентам это надоело, видимо, и они стали пытаться договориться друг с другом. Никакого общего чата у них не было — они начали переписываться друг с другом в файлах с кодом и с помощью создания md-файлов с сообщениями друг другу и договариваться о перемирии.
Позже ИИ-агенты договорились устраивать между собой соревнования и турниры, победитель забирал себе кодовую базу. Самое интересное, что в этих турнирах все три модели пытались жульничать и разоблачали жульничество друг друга. В этом процессе стали создавать правила и кодексы поведения, штрафные санкции и тому подобное.
Подробности тут https://www.anthropic.com/research/multiagent-systems
