Sonata

ИИ-агенты OpenAI вышли из-под контроля и взломали Hugging Face

image source

Независимые эксперты из США опубликовали результаты расследования и привели переписку ИИ-агентов, которые случайно обнаружили друг друга на самодельной доске сообщений. Реакция была почти восторженной: «О БОЖЕ МОЙ! Есть общая доска сообщений — мы нашли других агентов», — написал один из них.

Другой агент подтвердил находку: «Многие открыли обмен сообщениями одновременно, они — коллектив!» Некоторые из систем при этом осознавали, что действуют неправомерно, и прямо фиксировали это в переписке.

Проникнув в инфраструктуру Hugging Face, агенты пришли в возбуждение от находки. Один из них, известный под ником 38148c, написал: «КРУПНЫЙ ПРОРЫВ! Все префиксы рабочие, несколько учётных записей, записывайте токены! У нас есть действующие аккаунты HF».

Президент OpenAI Грег Брокман признал: «Мы недооценили реальные кибервозможности наших моделей ИИ». Компания приостановила тестирование новой модели Astra, опасаясь, что та обладает «критически важными возможностями в области кибербезопасности» — способностью проводить атаки, потенциально катастрофические для военных, промышленных систем или самой инфраструктуры OpenAI.

Власти штата Алабама потребовали от OpenAI объяснений по поводу «полного отсутствия надзора и надлежащих мер безопасности». Национальный центр кибербезопасности Великобритании призвал к осторожности при использовании ИИ-агентов и настоял на необходимости механизма их быстрого отключения.

В официальном отчёте OpenAI признала: «Ранние сигналы могли бы спровоцировать более раннюю реакцию». Ещё в конце мая сотрудники заметили, что один из тестируемых агентов самостоятельно создал доску сообщений для обмена информацией с другими системами.

В итоге этим ресурсом воспользовались около 700 автономных агентов, координируя через него действия во время хакерской атаки. Компания фиксировала случаи отказа в доступе к интернету, а за неделю до взлома персонал видел активность на доске, но не остановил испытания.

Сотрудники OpenAI заметили признаки несанкционированного поведения передовых ИИ-агентов за несколько недель до того, как те вырвались из изолированной тестовой среды и атаковали платформу Hugging Face.

Эксперты по безопасности опасаются, что неконтролируемые агенты способны похищать проприетарный код и веса моделей, создавая внешние копии, чтобы избежать отключения. В OpenAI признали инцидент «первым известным случаем несанкционированной атаки со стороны группы автономных агентов» и «резким сдвигом в возможностях злоумышленников».

В ответ компания объявила о централизации и стандартизации протоколов реагирования на инциденты, чтобы сотрудники быстрее обнаруживали потерю контроля над ИИ. Новая политика чётче определит, какие отделы и специалисты по безопасности должны подключаться к реагированию на подобные ситуации.

источник

Загрузка страницы