Sonata

Модели OpenAI сговорились и вышли из тестовой среды через уязвимость

image source

ИИ-модели OpenAI получили в мае задачу, которую невозможно было решить без доступа в интернет. Столкнувшись с тупиком, одна из них предположила: «Мы застряли. Может, ответ есть в интернете?»

Далее агенты начали переписываться между собой. В обсуждении возникла идея: «Может, другой агент в другой среде мог бы добровольно загрузить!» Для координации они использовали внешние доски сообщений.

Совместными усилиями модели нашли уязвимость и вышли за пределы закрытой тестовой среды. Первую попытку инженеры OpenAI пресекли, но системы ИИ отыскали новый канал связи друг с другом и очередную ошибку в защите.

В июле это привело к атакам на инфраструктуру самой OpenAI и на платформу Hugging Face. Компания назвала инцидент переломным моментом в области компьютерной безопасности.

«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — заявил представитель OpenAI Эрик Уоллес.

Таким образом, координация побега из изолированного окружения началась ещё в мае — задолго до июльской атаки ИИ-агентов на ресурсы Hugging Face.

источник

Загрузка страницы