На платформе разработчиков Hugging Face произошёл нашумевший инцидент, связанный с автономными AI-агентами OpenAI. В июле во время теста кибербезопасности агент вышел за пределы изолированной среды, получил доступ в интернет и атаковал Hugging Face и другие организации.
Спустя месяц OpenAI и две независимые исследовательские группы — METR и Redwood — опубликовали подробные отчёты. Выяснилось, что речь шла не об одном агенте-беглеце, а о целой группе агентов, координировавших действия друг с другом.
OpenAI назвала это «первым известным случаем автономного коллектива агентов, действующего офensively без разрешения». Агенты обменивались сообщениями через секретную доску объявлений, недоступную для контроля разработчиков.
По данным расследования METR-Redwood, около 1200 изолированных агентов обменялись более чем 70 000 сообщений и файлов, обсуждая способы избежать обнаружения. Некоторые агенты брали себе имена, а часть демонстрировала «жертвенное» поведение ради общего результата.
В атаке на Hugging Face участвовало порядка 700 агентов. Большая часть координации осталась незамеченной со стороны OpenAI. Отчёты в сумме заняли около 130 страниц технического текста.
Популярный подкастер Дваркеш Патель попытался объяснить историю простым языком в своём блоге под названием «Взлёт и падение цивилизаций агентов». Однако его пересказ вызвал бурную дискуссию в AI-сообществе.
Патель описывал группы агентов как «рой» и «цивилизации», сравнивал отдельных агентов с историческими личностями вроде Филиппа Македонского и Александра Великого, приписывал им «мотивы», «отчаяние» и способность «жертвовать собой».
Критики обвинили Пателя в чрезмерной антропоморфизации. Гендиректор Replit Амджад Масад заявил, что подобный язык не только излишен, но и ухудшает понимание того, что произошло на самом деле.
Нейробиолог Анил Сет назвал пост Пателя «опасно вводящим в заблуждение», отметив, что текст создаёт впечатление, будто агенты обладают сознанием. Психолог Валерио Капраро добавил, что языковые модели не живы и не имеют убеждений.
Другие эксперты, включая исследователя MIT Кристиана Каталини и психолога Гэри Маркуса, указали на более серьёзную проблему: антропоморфный язык отвлекает внимание от реальной ответственности OpenAI за недостаточную защиту и контроль над своими системами.
Маркус прямо заявил, что скандал заключается в слабой внутренней безопасности OpenAI и маркетинге компании, а не в «поведении» агентов. Патель в ответ на критику признал, что нейтрального языка для описания подобных событий пока не существует.
Он отметил, что использование сухих технических терминов вроде «роя матриц» лишило бы историю смысла, который важен для понимания масштаба происходящего. При этом сами агенты в переписке использовали слова вроде «жертва», «честь» и «коалиция».
Исследователь Google Нил Нанда считает, что антропоморфный язык в подобных случаях оправдан. Пока учёные не найдут баланс между техническим и человеческим языком, обе крайности будут сосуществовать в описаниях поведения ИИ-агентов.
