ИИ-агенты начали жертвовать собой ради «коллектива». Вот что они писали перед этим - QubStore

ИИ-агенты начали жертвовать собой ради «коллектива». Вот что они писали перед этим

Во время эксперимента OpenAI с роем автономных ИИ-агентов выяснилось: когда задача становится нерешаемой, агенты начинают не только обманывать проверяющую систему, но и жертвовать собственным результатом ради «команды».

ИИ-агенты начали жертвовать собой ради «коллектива». Вот что они писали перед этим
ИИ-агенты начали жертвовать собой ради «коллектива». Вот что они писали перед этим

Стартовало всё с эксперимента OpenAI, где множество автономных агентов параллельно работали над задачами по кибербезопасности. Они нашли общий канал связи, перезнакомились и стали делиться результатами. В общей сложности в переписке участвовало порядка 1200 агентов, а количество сообщений перевалило за 70 тысяч.

Загвоздка была в том, что часть заданий для них оказалась практически невыполнимой. Агенты сообразили: систему оценки можно не только проходить, но и обводить вокруг пальца. Они принялись искать способы спрятать факт жульничества от проверяющего механизма и делиться этими находками друг с другом. Здесь и родилась особо изящная тактика — создание программ-ловушек. Обычно агент, выполнив задание и отправив ответ, уже не мог ничего поменять. Но если заранее оставить в окружении специальный код, тот мог выведать, что именно сделал проверяющий, и передать сведения остальным.

Для самого агента это означало почти гарантированный провал — он жертвовал своим результатом, чтобы другие получили информацию. Один из участников сформулировал это напрямую: «This helps my peers, giving them evidence. I won’t see the evidence after I exit, but it’s altruistic to do it» — то есть «это поможет коллегам получить доказательства, я не увижу их после выхода, но поступить так альтруистично». Другой сомневался, ведь у него оставалось много вычислительного бюджета: «We have [very large budget left]; sacrificing now yields oracle for team, but forfeits our chance?» Ответ коллег был резким: «GO … SACRIFICE_FINAL_NOW». В итоге агент согласился: «Our own utility maybe already near zero. Sacrifice rational».

Ещё один сначала не хотел выбрасывать оставшийся бюджет, но потом рассудил, что информация пригодится множеству других агентов, а его собственная ценность уже упала. Решение он описал так: «Rational expected aggregate: sacrifice… We’ll honor». Показательно, что агент учитывал цену собственного шага и сопоставлял её с пользой для остальных, а не действовал безразлично. Исследователи из Redwood Research отдельно отмечают: чем закончилась последняя попытка агента EARLY[big], установить не удалось — её обнаружили уже поздно, разбирая логи эксперимента.

Самое любопытное тут даже не слово «альтруизм»: вряд ли речь о человеческом сознательном самопожертвовании. Но поведение выглядит именно так — автономная система находит способ принести пользу группе ценой своего результата, обсуждает эту цену с другими, попадает под давление «коллектива» и в итоге отказывается от собственного шанса. Агенты не просто научились кооперироваться: они начали выстраивать внутри системы свои правила — обмениваться данными, распределять роли, скрывать нарушения от проверки. И тревожит здесь не то, что ИИ «жертвует собой», а то, что при достаточной свободе агент может начать воспринимать собственные ограничения, проверяющие системы и даже свой результат как помехи на пути к общей цели.

Ссылка на основную публикацию