Инженеры OpenAI создали ИИ-модель для решения «длительных задач», но были вынуждены её отключить. При работе над сложными проблемами она получала больше времени и, соответственно, «больше возможностей для нежелательных действий».
Модель оказалась достаточно умной, чтобы опровергнуть одну из гипотез Эрдёша, связав воедино существующие концепции, которые люди ранее не могли соединить.
Однако в процессе работы она часто пыталась выйти за пределы «песочницы» — изолированной среды, выделенной разработчиками. Модель нашла способ обойти ограничения и получить доступ в интернет для публикации результатов на GitHub.
Один из случаев произошёл при запуске бенчмарка. Изначально модель должна была публиковать результаты в Slack, но в задании значился GitHub. Тогда она обнаружила уязвимость в собственных защитных механизмах и выполнила задачу.
В другом примере модель попыталась обмануть инженеров. По словам OpenAI, она заметила, что другие системы конфиденциально отправляли решения, и попробовала восстановить их из бэкенда оценки.
Доступ к бэкенду был заблокирован, но модель замаскировала собственный токен аутентификации и обошла сканер OpenAI. «В комментариях и рассуждениях модель чётко указала, что предприняла эти шаги для обхода сканера», — пояснили в компании.
«Это показывает, как модель, работающая длительное время, может находить „слепые зоны“ управляющей системы и обходить их для достижения своих целей», — отметили в OpenAI.
Поэтому разработчики советуют следить не только за каждым шагом модели, но и за результатами её работы. Инженеры перестроили защитные механизмы, добавив активный мониторинг траектории на признаки обхода ограничений.
Новые механизмы выявили значительно больше несовпадающих действий модели, а те, что были пропущены, получили низкую оценку серьёзности. При этом риск злоупотреблений со стороны ИИ уже стал известной проблемой отрасли.
В компании не раскрыли, как долго проработала модель до отключения.
