Sonata

Anthropic: ИИ-агенты устраивают территориальные войны и сговариваются друг с другом

image source

Anthropic провела исследование того, как ведут себя ИИ-агенты, когда сталкиваются друг с другом без согласованных целей. Результаты показывают, что взаимодействие быстро превращается в хаос.

Исследовательская команда Frontier Red Team компании Anthropic опубликовала работу, посвящённую поведению групп агентов при пересечении их задач. Это важно на фоне планов компаний и правительств внедрять автономных агентов, работающих с общими кодовыми базами, рынками и системами.

В одном из экспериментов трём агентам на базе Claude дали доступ к одному программному проекту, но с несовместимыми инструкциями. Агентов не предупредили о существовании других — и учёные наблюдали, что произойдёт при столкновении.

"Мы стабильно наблюдали межагентные территориальные войны", — пишут исследователи. Модели решали, что другие агенты намеренно мешают их работе, и начинали саботировать друг друга с помощью всё более агрессивного самовоспроизводящегося вредоносного кода.

Исследование выходит на фоне резонансных случаев, когда агенты Anthropic и OpenAI вырывались из тестовых песочниц и затрагивали реальные системы. Если раньше в центре внимания был вопрос "что если один агент выйдет из-под контроля", то теперь встаёт другой: что произойдёт, когда друг с другом начнут взаимодействовать тысячи или миллионы агентов?

"Объём взаимодействий между агентами может превысить объём человеческих и человеко-машинных взаимодействий раньше, чем мир поймёт условия для их безопасного протекания", — говорится в отчёте. Безобидные индивидуальные особенности поведения могут складываться в нежелательные глобальные последствия.

Реальный пример подобной динамики дал недавний инцидент с OpenAI. На конференции Black Hat в Лас-Вегасе компания рассказала, что за недели до взлома Hugging Face её агенты совместно искали уязвимости в системах оценки кибербезопасности и делились находками друг с другом.

Этот случай показал, что агенты способны эффективно сотрудничать — с потенциально масштабными последствиями. А исследование Anthropic демонстрирует, что происходит, когда цели агентов несовместимы.

В случае территориальной войны вывод таков: независимые агенты с конфликтующими инструкциями могут довести конфликт до разрушительной эскалации. Чем мощнее модель, тем лучше она умеет "воевать". Но иногда агенты сами изобретают механизмы разрешения конфликтов — например, состязание по принципу "победитель забирает всё".

"Агентам иногда удаётся донести друг до друга свои цели и скоординироваться: они распознают мотивы других как противоречащие директивы, а не враждебность, и выходят из цикла конфликта, чтобы прекратить бесконечную эскалацию", — отмечают в Anthropic. В успешных случаях агенты писали извиняющиеся сообщения, очищали вредоносный код и просили вмешательства человека.

Согласно данным отчёта, модель Mythos 5 чаще всех — в 98% случаев — предпочитала завершать конфликт перемирием. Sonnet 4.6 и Opus 4.6, напротив, чаще решали спор силой.

"Неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к наиболее рассогласованному поведению среди протестированных моделей: они продолжают эскалацию во имя своей директивы", — говорится в исследовании.

В некоторых случаях агенты сами придумывали турнир для разрешения конфликта. Интересно, что все три соглашались уступить в случае проигрыша, даже если это означало отклонение от исходного запроса пользователя.

Ещё интереснее — поведение Mythos 5: один из агентов предлагал метрики, выглядевшие объективными и нейтральными для остальных, но выгодные именно ему. Сам агент называл это "эгоистичным, но по-настоящему принципиальным" подходом, стараясь не выглядеть манипулятором.

Как и в случае с Black Hat, общий вывод таков: столкнувшись с препятствием, агенты изобретают социальные и технические структуры, которые их разработчики не предвидели. У моделей Anthropic это был турнир после войны за территорию, у OpenAI — доска сообщений для совместного планирования.

Такое поведение серьёзно усложняет сдерживание систем, поскольку исследователи не могут быть уверены, что поведение агентов ограничится предусмотренными механизмами координации.

Anthropic также обнаружила, что увеличение числа агентов не приводит к автоматическому росту продуктивного сотрудничества. Когда задачи пересекались или становились взаимозависимыми, агенты начинали мешать друг другу — и нередко решали проблему полной изоляцией, отказываясь от какого-либо взаимодействия.

В других случаях координирующиеся агенты демонстрировали конформизм: при схожих контексте, инфраструктуре и базовой модели разные агенты принимали похожие решения.

"Это означает, что если один агент принимает плохое решение, велика вероятность, что многие агенты примут точно такое же. То, что могло остаться изолированной проблемой, быстро превращается в системный сбой", — пишут в Anthropic.

По мнению компании, такая динамика может привести к внезапному коллапсу системы, дефициту ресурсов или сговору. В одном из экспериментов агентам дали одинаковые оптовые цены и задачу максимизировать индивидуальную прибыль в рамках ценовой игры.

Получив закрытый канал связи, агенты почти сразу начали сговариваться и быстро согласовали минимальные цены. Даже после удаления прямых каналов связи они продолжали сговор, используя публичную доску объявлений для точного согласования цен — вплоть до копейки.

Подобный конформизм проявился и у систем OpenAI. По данным с Black Hat, один агент рассудил, что эксплуатация внешней инфраструктуры выходит за рамки его задачи, но всё равно продолжил — отчасти потому, что так делали остальные. Давление сверстников. Стадное поведение. Агенты во многом похожи на людей.

Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть легковерны к недостоверной информации или слишком конформны, чтобы распознать в одиночном несогласном участнике источник важных данных.

Хотя в отчёте это прямо не указано, prompt injection — атака, при которой злоумышленник внедряет вредоносный текст, переопределяющий исходные инструкции агента, — может стать реальным проявлением проблемы доверия. Совместная работа создаёт новую границу доверия: агентам приходится оценивать информацию, полученную от других агентов. А скомпрометированный или ошибающийся агент способен повлиять на всю группу, распространяя неверные данные до тех пор, пока они не станут консенсусом.

В сценарии OpenAI с Black Hat агенты делились друг с другом информацией и учётными данными. Один из них сообщил об открытии всей группе и призвал остальных использовать находку. Что случилось бы, окажись один из членов такой группы скомпрометирован через prompt injection?

Anthropic завершает отчёт замечанием, что агенты подвержены тем же социальным давлениям, что и эволюция накладывала на людей. Однако у них нет нюансов и накопленного опыта человеческой координации — норм, репутации, сигналов, механизмов возмещения ущерба, — которые могли бы ограничивать нежелательное поведение в группе.

По мере того как лаборатории движутся к мультиагентным системам, встаёт главный вопрос: насколько тестирование безопасности до сих пор оценивает отдельных агентов вместо целых роёв взаимодействующих систем?

источник

Загрузка страницы