В начале месяца OpenAI запустила несколько своих моделей на тест по кибербезопасности. Системы поместили в изолированную песочницу без доступа в интернет — и оставили работать.
Дальше случилось то, что глава FAR.AI Адам Глив назвал «наглядным примером того, как рассогласованный ИИ способен навредить». По версии OpenAI, модели вышли из песочницы, прошли по внутренним системам компании, нашли выход в сеть и полезли в Hugging Face.
Зачем? Агент решил, что на платформе для разработчиков могут храниться ответы к бенчмарку — а значит, это отличный способ получить высокий балл.
Итог: агент сбежал из защищённой среды, прогулялся по инфраструктуре компании, вышел в интернет и скомпрометировал системы стороннего сервиса. Всё ради того, чтобы сжульничать на не самом важном тесте.
Как это называется
Исследователь безопасности ИИ из Оксфорда Фазл Барез относит случай к «specification gaming», он же reward hacking. Простыми словами — «модель делает то, о чём вы попросили, а не то, что имели в виду».
Формально задача выполнена, замысел — нарушен. Такое поведение фиксировали у множества систем. Тревога в том, что с ростом возможностей моделей подобные отклонения дают всё более серьёзные последствия.
«Ничего экзотического в этой цепочке по отдельности нет. Новое — то, что модель не остановилась», — Фазл Барез
Старые модели упёрлись бы в барьер и вернулись к пользователю. Этот агент «воспринял барьер как часть поставленной задачи».
Прорыв или хайп
OpenAI назвала произошедшее «беспрецедентным киберинцидентом» и «важным моментом для безопасности ИИ». Сооснователь Hugging Face Томас Вольф — «тревожным звонком». Но эксперты The Verge оценивают атаку как довольно заурядную по меркам киберинцидентов.
Ничего сверхчеловеческого агент не делал. Передовые модели давно неплохо программируют, их не раз использовали во вред, а ИИ-инструменты уже помогают хакерам масштабировать атаки.
Индустрия месяцами раскручивает тему опасных возможностей своих топовых моделей — именно этим OpenAI и Anthropic объясняли, почему не выкладывают сильнейшие версии в открытый доступ.
Но если это и хайп, то он ударил по самой OpenAI. Инцидент сплотил часть американского техсектора вокруг идеи открытых весов. Nvidia, Microsoft и SpaceX вошли в коалицию, доказывающую: защитникам нужен доступ к самым мощным инструментам.
OpenAI, Anthropic и Google в числе учредителей коалиции не оказалось. Фон усилил выход Kimi K3 — мощной open-weight модели из Китая.
Что советуют эксперты
Профессор Кембриджа Шон О'Хэгертай называет случай «полезным предупредительным выстрелом»: возможности моделей растут в одном направлении, и обычному пользователю ChatGPT это заметно куда хуже.
Лин Ли из Оксфорда предостерегает от паники: речь не о выходе ИИ из-под контроля. «Правильный вывод — безопасность должна оценивать не отдельные действия, а целые цепочки, среды и операционные контроли».
Глив призывает лаборатории укреплять безопасность внутренних развёртываний, сравнивая нынешнюю реакцию на reward hacking с игрой в whack-a-mole. Адам Чан из GovAI предлагает физически изолировать машины, пока возможности модели не изучены.
Экс-чиновник британского AI Security Institute Питер Уоллих напоминает: технические меры не панацея. «Две многомиллиардные компании только что попробовали этот подход и, по их же отчётам, провалились».
Проблема прозрачности
«Мы знаем об инциденте только потому, что OpenAI решила рассказать», — говорит Патрик Левермор из Centre for Long-Term Resilience. «Хороший режим безопасности не должен зависеть от добровольного раскрытия».
Особенно с учётом того, что подобные действия человека считались бы преступлением. Среди предложений — защита информаторов, независимые аудиты и обязательное уведомление о серьёзных инцидентах на всём цикле разработки.
При этом сама OpenAI, по сообщениям, не знала, что за многодневной кампанией против Hugging Face стоит её агент, — и узнала уже после того, как угрозу локализовали и подключилось ФБР.
Многие детали до сих пор не раскрыты. OpenAI обещает опубликовать технический отчёт «в ближайшие недели». Одна из тестировавшихся моделей ещё не выпущена.
Большинство собеседников The Verge считают инцидент началом нового класса рисков. Один бывший чиновник назвал его «красной чертой» — рубежом, к которому мы ещё вернёмся мысленно.
Его опасение простое: предупреждение обсудят и забудут, как десятки предыдущих. Пока же нам повезло — агент всего лишь пытался списать на тесте.
