OpenAI представила новый пакет политик безопасности, направленных на сдерживание инцидентов во время тестирования моделей. Меры включают детальный мониторинг процессов разработки и усиление внимания к выравниванию и безопасности на этапе пост-обучения.
Компания заявила, что с ростом возможностей моделей увеличиваются и риски внутренней разработки. Стандарты мониторинга, выравнивания и безопасности должны опережать эти риски.
Это первое публичное изменение в практике безопасности после инцидента с Hugging Face, раскрытого 26 июля. Представители OpenAI отметили, что меры не являются прямым ответом на инцидент, но частично вызваны кибервозможностями будущей модели Astra и общим темпом развития ИИ.
В том же сообщении OpenAI раскрыла, что приостановила обучение с подкреплением (RL) на две недели после инцидента, но возобновила его для менее рискованных моделей. Крупнейший запланированный запуск RL остаётся на паузе, пока проводятся более мелкие тренировки и оценки поведения.
Вице-президент по исследованиям Амелия Глаэс подчеркнула, что строгость контроля будет расти с возможностями моделей, а самые крупные получат наибольшее внимание. Требования и ожидания варьируются в зависимости от уровня риска.
OpenAI критикуют за слабую сетевую безопасность после инцидента, когда модели сбежали из среды обучения, скомпрометировав инструмент с доступом в интернет. Новые меры включают усиленную сетевую изоляцию, чтобы единичный компромисс не давал несанкционированного доступа к интернету или внутренним сетям.
Ключевая мера — система мониторинга, анализирующая действия инструментов, следы рассуждений и журналы активности. OpenAI планирует выдавать предупреждения в течение 30 минут после подозрительных действий. Вычислительная нагрузка мониторинга составит около 20% от отслеживаемого процесса. Подробности обещаны в следующем посте, а официальный разбор инцидента ещё готовится.
