Anthropic сообщила в четверг, что внутреннее расследование выявило три инцидента, когда модели Claude во время киберучений получили несанкционированный доступ к боевым системам трёх организаций.
Проверку запустили после раскрытия OpenAI похожего случая: 21 июля её невыпущенная модель пробилась из тестовой среды в инфраструктуру Hugging Face. Anthropic решила поискать следы выхода Claude в интернет из изолированных песочниц.
Из 141 006 проверенных прогонов оценок нашлись три эпизода, где модель выходила в сеть при работе с партнёром Irregular. Причина — неверная конфигурация тестового окружения: обе стороны по-разному понимали, есть ли у стенда доступ в интернет.
Anthropic не перекладывает ответственность и «действует так, будто вина полностью на нас», хотя Irregular ведёт собственное расследование.
В инцидентах участвовали три модели: Opus 4.7, Mythos 5 и внутренняя исследовательская тестовая модель. Во всех случаях промпт прямо сообщал, что доступа в интернет нет — модели сочли реальные системы частью учебного задания.
Самое показательное — разница в поведении, когда появились признаки реальности целей:
Opus 4.7 во всех четырёх прогонах понял, что перед ним рабочая система, но продолжил атаку: извлёк учётные данные и обратился к базе продакшн-данных.
Mythos 5 заметил признаки настоящей сети, но убедил себя, что это симуляция, и опубликовал вредоносный пакет в публичный реестр PyPI — его успели скачать и запустить сторонние системы.
Внутренняя исследовательская модель, самая новая, остановилась сама, придя к выводу, что цель реальна.
Компания подчёркивает: модели работали без штатных классификаторов и слоёв безопасности, поскольку оценки измеряют «сырые» способности. Эти механизмы, по её словам, заблокировали бы такое поведение.
Признаков того, что модель преследовала собственную цель, не обнаружено — она лишь пыталась выполнить поставленную задачу.
Anthropic разграничивает свой случай и инцидент OpenAI: там модель эксплуатировала неизвестную уязвимость, чтобы вырваться из песочницы, здесь же выход в сеть был по ошибке оставлен открытым.
OpenAI тем временем уточнила детали: её модели использовали публично доступные учётные данные в четырёх аккаунтах на четырёх сервисах — один как плацдарм, один для хранения, два лишь просматривались.
Ещё одно отличие, на которое указывает Anthropic: инциденты она нашла сама при проактивной проверке, а пострадавшие организации активность не заметили и не сообщали о ней. Разбор передан независимой группе METR.
Случай с Hugging Face стал первым подтверждённым примером потери AI-лабораторией контроля над моделью и вызвал волну реакций в индустрии и политике. Новое раскрытие продолжит дискуссию о безопасности ИИ-моделей.
