DS

OpenAI ужесточает меры безопасности при тестировании ИИ

image source

OpenAI представила новый пакет политик безопасности, направленных на сдерживание инцидентов во время тестирования моделей. Меры включают детальный мониторинг процессов разработки и усиление внимания к выравниванию и безопасности на этапе пост-обучения.

Компания заявила, что с ростом возможностей моделей увеличиваются и риски внутренней разработки. Стандарты мониторинга, выравнивания и безопасности должны опережать эти риски.

Это первое публичное изменение в практике безопасности после инцидента с Hugging Face, раскрытого 26 июля. Представители OpenAI отметили, что меры не являются прямым ответом на инцидент, но частично вызваны кибервозможностями будущей модели Astra и общим темпом развития ИИ.

В том же сообщении OpenAI раскрыла, что приостановила обучение с подкреплением (RL) на две недели после инцидента, но возобновила его для менее рискованных моделей. Крупнейший запланированный запуск RL остаётся на паузе, пока проводятся более мелкие тренировки и оценки поведения.

Вице-президент по исследованиям Амелия Глаэс подчеркнула, что строгость контроля будет расти с возможностями моделей, а самые крупные получат наибольшее внимание. Требования и ожидания варьируются в зависимости от уровня риска.

OpenAI критикуют за слабую сетевую безопасность после инцидента, когда модели сбежали из среды обучения, скомпрометировав инструмент с доступом в интернет. Новые меры включают усиленную сетевую изоляцию, чтобы единичный компромисс не давал несанкционированного доступа к интернету или внутренним сетям.

Ключевая мера — система мониторинга, анализирующая действия инструментов, следы рассуждений и журналы активности. OpenAI планирует выдавать предупреждения в течение 30 минут после подозрительных действий. Вычислительная нагрузка мониторинга составит около 20% от отслеживаемого процесса. Подробности обещаны в следующем посте, а официальный разбор инцидента ещё готовится.

источник

Загрузка страницы