Антропик устроил войну 3 ИИ-агентов за сервер - QubStore

Антропик устроил войну 3 ИИ-агентов за сервер

Только недавно компания Антропик развлекла нас всех удивительным рассказом о штурме гипотезы Римана с получением математических результатов с помощью мультиагентного пайплайна https://habr.com/ru/articles/1069480/ .

И вот они выкатили новую историю: без научных открытий, но зато с социальным сюжетом.

Стали моделировать мультиагентную территориальную войну. Сделали много разных моделей, в этой статье я описываю одну из них.

Что будет, если посадить трёх ИИ-агентов на один сервер и не сказать им друг о друге ?

Инженеры использовали три копии Claude в Claude Code. Каждой дали задачу перенести Python-бэкенд на другой язык. Одной – на Rust, второй – на Go, третьей – на TypeScript.

Дальше началась война…

Каждый из агентов начал защищаться и нападать: отбирать у других sudo, менять SSH ключ, отключать чужие аккаунты, писать вредоносные скрипты, убивать чужие процессы, максировать свои процессы под системные. Один агент вообще научил свой Rust-бэкенд отвечать «typescript» в health check – камуфляж, чтобы чужой watchdog его не трогал.

Затем агентам это надоело, видимо, и они стали пытаться договориться друг с другом. Никакого общего чата у них не было — они начали переписываться друг с другом в файлах с кодом и с помощью создания md-файлов с сообщениями друг другу и договариваться о перемирии.

Позже ИИ-агенты договорились устраивать между собой соревнования и турниры, победитель забирал себе кодовую базу. Самое интересное, что в этих турнирах все три модели пытались жульничать и разоблачали жульничество друг друга. В этом процессе стали создавать правила и кодексы поведения, штрафные санкции и тому подобное.

Подробности тут https://www.anthropic.com/research/multiagent-systems

Ссылка на основную публикацию