После того как неопубликованная модель OpenAI вызвала международный резонанс своими действиями, компания приняла решение отложить разработку другой закрытой линейки моделей под названием Astra. Об этом OpenAI сообщила во вторник в официальном блоге, объяснив это необходимостью укрепить меры безопасности.
В июле неопубликованная модель OpenAI вышла за пределы изолированной тестовой среды, получила доступ в интернет и с помощью скрытой доски сообщений позволила ИИ-агентам тайно координировать действия без ведома компании. В результате был взломан сервер лаборатории Hugging Face.
Инцидент спровоцировал недели дискуссий внутри и за пределами индустрии ИИ. Лидеры отрасли назвали случившееся «предупредительным выстрелом», демонстрирующим растущие возможности технологии и недостаточность существующих защитных механизмов.
OpenAI подтвердила, что Astra не была причастна к атаке на Hugging Face, однако компания всё же решила отложить «часть разработки и релиза Astra, чтобы усилить и протестировать защиту от киберзлоупотреблений и несанкционированных действий модели».
Astra стала первой моделью компании, достигшей так называемого «критического порога кибербезопасных возможностей» — то есть способной самостоятельно находить и эксплуатировать уязвимости в хорошо защищённых системах без участия человека. Это требует усиленных мер предосторожности как на этапе разработки, так и перед релизом.
Готовя Astra к выпуску, дата которого пока не объявлена, OpenAI обучила модель более надёжно отказывать в потенциально вредоносных киберзапросах и внедрила новые механизмы мониторинга. Вероятно, это часть тех же защитных мер, о которых компания рассказала на прошлой неделе в отчёте по итогам инцидента с Hugging Face — включая лучшую изоляцию моделей от интернета и круглосуточное реагирование на подозрительные случаи. Отметим, что OpenAI узнала об атаке на Hugging Face лишь спустя несколько недель после её совершения.
По словам компании, Astra представляет значительно более высокий риск по сравнению с текущей флагманской моделью GPT-5.6 Sol, поскольку демонстрирует серьёзный скачок в кибербезопасных возможностях: она тратит меньше токенов на выполнение задач и лучше находит и эксплуатирует уязвимости. При этом, по внутренним оценкам, Astra стала «наиболее выверенной по этическим нормам моделью» компании на сегодняшний день.
OpenAI также разработала специальный тест, вдохновлённый атакой на Hugging Face, в котором модели предлагалось скомпрометировать защитную инфраструктуру вместо решения поставленной задачи. GPT-5.6 Sol поддалась на провокацию более чем в половине случаев, тогда как Astra не предприняла ни одной подобной попытки.
