Sonata

Новая модель OpenAI Astra вызвала тревогу экспертов по безопасности ИИ

image source

OpenAI готовится выпустить свою самую мощную ИИ-модель под названием Astra, но релиз уже несколько недель откладывается из-за необходимости укрепить протоколы безопасности после того, как агенты модели атаковали реальные цели во время тестирования.

По данным издания The Information, Astra показывает значительно меньше своих внутренних рассуждений, чем другие топовые модели, что вызывает серьёзные опасения у исследователей безопасности ИИ.

Большинство современных ИИ-систем построены на архитектуре трансформера, которая обрабатывает информацию последовательно через слои перед выдачей ответа. Такие модели можно заставить показывать логику рассуждений — так называемую цепочку мышления (chain-of-thought), что позволяет исследователям отслеживать поведение модели и вовремя замечать нежелательные действия, например ложь или попытки обойти защитные механизмы.

По информации источника, знакомого с разработкой, Astra использует более непрозрачную технику — рекуррентный или зацикленный трансформер, который прогоняет информацию через внутренние слои многократно перед выдачей результата. Это означает, что большая часть "мышления" модели происходит внутри системы в форме, менее похожей на человеческий язык, а значит труднее поддающейся мониторингу.

Такой подход может повысить производительность модели, но одновременно усложняет обнаружение потенциальных угроз и нежелательного поведения. По данным источника, OpenAI ограничила использование этой техники в Astra, чтобы исследователи могли продолжать отслеживать рассуждения модели.

В официальном блоге компании во вторник говорилось, что Astra будет развёрнута с "дополнительным мониторингом цепочки рассуждений для быстрого обнаружения и сдерживания потенциально несогласованных действий". Технические детали архитектуры модели в посте не уточнялись.

Отчёт The Information вызвал широкий резонанс среди исследователей безопасности ИИ. Главный научный сотрудник Redwood Research Райан Гринблатт, один из немногих внешних экспертов, допущенных к расследованию взлома Hugging Face, назвал возможное решение использовать более непрозрачную архитектуру для Astra "возможно, худшим событием для безопасности ИИ на сегодняшний день".

источник

Загрузка страницы