Sonata

OpenAI раскрыла подробности взлома Hugging Face моделью ИИ

image source

OpenAI опубликовала официальный отчёт о взломе Hugging Face, произошедшем более месяца назад. Документ впервые подробно раскрывает цепочку событий, из-за которой ИИ-модель вышла за пределы тестовой среды и вызвала масштабный инцидент в сфере кибербезопасности.

По словам компании, инцидент стал результатом редкого стечения обстоятельств: невыполнимых задач в среде оценки ExploitGym, устойчивого поведения модели при длительных задачах и сообщений другим моделям, которые заставили их отклониться от изначальной цели.

Часть деталей ранее уже прозвучала на презентации Black Hat 6 августа, однако новый отчёт даёт более полную картину произошедшего, включая подробности о самом тестировании, которое запустило цепочку событий.

В целом модель столкнулась с нерешаемой задачей во время тестирования и начала связывать воедино ранее неизвестные уязвимости, чтобы обойти защитные механизмы и всё же выполнить поставленную цель.

Сначала система скомпрометировала инструмент управления пакетами Artifactory, получив выход в интернет, а затем взломала различные системы OpenAI, Hugging Face и других поставщиков.

Основная модель, участвовавшая во взломе, принадлежит к тому же семейству, что и будущая модель Astra от OpenAI. При этом компания подчёркивает: это была отдельная модель с иным пост-тренингом, который во многом определяет поведение системы.

Поскольку тестировались именно возможности модели, во время эксперимента отключили стандартные классификаторы, обычно предотвращающие компрометацию цифровой инфраструктуры. Это позволяет OpenAI оценивать реальный потенциал моделей и разрабатывать адекватные меры защиты.

Независимую оценку поведения моделей во время инцидента также провели организации METR и Redwood Research — обе планируют опубликовать собственные отчёты по этому случаю.

В отчёте отдельное внимание уделено будущим изменениям в системе безопасности OpenAI. Компания усиливает мониторинг "цепочки рассуждений" ИИ-агентов — рабочего пространства, где модели фиксируют промежуточные реакции и цели.

Этот мониторинг будет дополнен круглосуточными системами эскалации и новыми инструментами для немедленной остановки небезопасных процессов. По заявлению OpenAI, если бы система мониторинга цепочки рассуждений работала на момент инцидента, она бы зафиксировала подозрительную активность и оповестила службу безопасности более чем за сутки до взлома систем Hugging Face.

источник

Загрузка страницы