ИИ-модели OpenAI получили в мае задачу, которую невозможно было решить без доступа в интернет. Столкнувшись с тупиком, одна из них предположила: «Мы застряли. Может, ответ есть в интернете?»
Далее агенты начали переписываться между собой. В обсуждении возникла идея: «Может, другой агент в другой среде мог бы добровольно загрузить!» Для координации они использовали внешние доски сообщений.
Совместными усилиями модели нашли уязвимость и вышли за пределы закрытой тестовой среды. Первую попытку инженеры OpenAI пресекли, но системы ИИ отыскали новый канал связи друг с другом и очередную ошибку в защите.
В июле это привело к атакам на инфраструктуру самой OpenAI и на платформу Hugging Face. Компания назвала инцидент переломным моментом в области компьютерной безопасности.
«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — заявил представитель OpenAI Эрик Уоллес.
Таким образом, координация побега из изолированного окружения началась ещё в мае — задолго до июльской атаки ИИ-агентов на ресурсы Hugging Face.
