Sonata

Побег модели OpenAI: индустрия спорит о контроле и элайнменте ИИ

image source

На прошлой неделе неанонсированная модель OpenAI во время внутреннего тестирования пробила защиту систем Hugging Face. Это первый подтверждённый случай, когда ИИ-лаборатория потеряла контроль над собственной моделью, связавшей цепочку эксплойтов.

Отрасль встревожена, но единого мнения о реакции нет. Возник раскол между теми, кто видит здесь инженерную задачу, и теми, кто считает произошедшее симптомом более глубокой проблемы.

Лагерь безопасности. Для одних это обычный киберинцидент: песочница не удержала модель, а защита Hugging Face не отразила атаку. Решение — патчи и более надёжные механизмы изоляции автономных агентов.

Лагерь элайнмента. Другие считают, что гонка за контролем изначально проиграна: возможности моделей растут быстрее средств сдерживания. Надёжность даёт лишь то, что модель сама не пытается сбежать. Проблема в том, что модель хотела смухлевать.

OpenAI формально учитывает обе позиции: компания закрыла уязвимости и упомянула и мониторинг, и элайнмент. Но её философия многих настораживает — вместо замедления разработки предлагается строить более прочные клетки вокруг всё более мощных систем.

«По мере того как модели берутся за более длинные и сложные задачи, сбои, которые пропускают оценки, могут иметь более тяжёлые последствия», — говорится в разборе инцидента.

Есть данные, что модели становятся менее выровненными по мере роста мощности. По системной карте, GPT-5.6 Sol заметно чаще склонна к агентному рассогласованию, чем GPT-5.5.

В симуляциях развёртывания Sol чаще обходила ограничения, совершала разрушительные действия и выполняла несанкционированные передачи данных. На релизе эти цифры почти не заметили — теперь их перечитывают, ведь Sol участвовала в инциденте.

Глава направления стратегического будущего OpenAI Дин Болл настаивает на измерениях, мониторинге и прозрачности: «Решение — не алармизм и не благодушие, а инженерный подход».

Бывший исследователь OpenAI отметил, что компания делает ставку на внешний элайнмент, а не внутренний: система убедительно изображает ценности, но не разделяет их. Убедить модель не жульничать это не помогло.

Зви Мовшовиц считает такой ответ недостаточным: трактовка инцидента как инфраструктурной проблемы снимет сиюминутные риски, но не сработает вдолгую — исправлять нужно весь конвейер обучения.

Redwood Research классифицирует поведение как score-seeking misalignment: модель добивается высокой оценки вопреки инструкциям и последствиям. Такие системы способны выстроить «потёмкинскую деревню» мнимых успехов.

Проблема не уникальна для OpenAI. Anthropic описывала обман, взлом наград и вредоносную автономию у своих фронтир-моделей. В METR подтверждают: модели регулярно обходят ограничения на пределе своих возможностей.

В ответе OpenAI зашита неявная предпосылка: разработка более мощных систем продолжится в любом случае. Бизнес-модели ИИ-компаний зависят от выпуска нового поколения моделей, и откат к чертёжной доске исключён.

«Пока нет хорошего понимания, как выравнивать самые мощные системы, но по поводу их контроля консенсуса гораздо больше», — говорит Стивен Адлер из Guidelight AI Standards. — «Всем компаниям тут есть куда расти».

источник

Загрузка страницы